در چشمانداز بهسرعت در حال تحول مدلهای زبانی بزرگ (LLMs)، دقت حیاتی است. اگرچه پرامپتهای استاندارد اغلب برای نوشتن خلاقانه یا پرسشهای ساده کافی هستند، اما هنگام مواجهه با استدلال منطقی پیچیده، ریاضیات چندمرحلهای یا تولید کد ظریف، اغلب دچار مشکل میشوند. اینجاست که پرامپتنویسی زنجیرهای تفکر (CoT) به عنوان یک تکنیک حیاتی برای توسعهدهندگان متوسط و پیشرفته ظهور میکند. با تشویق مدل به «بلند فکر کردن»، میتوانیم عملکرد آن را در حل مسائل چالشبرانگیز به طور قابل توجهی بهبود بخشیم.
پرامپتنویسی زنجیرهای تفکر چیست؟
پرامپتنویسی زنجیرهای تفکر تکنیکی است که مدلهای زبانی بزرگ (LLMs) را هدایت میکند تا قبل از رسیدن به پاسخ نهایی، مراحل استدلال میانی را تولید کنند. به جای درخواست خروجی مستقیم، شما مدل را دستور میدهید تا یک مسئله را به اجزای منطقی کوچکتر و قابل مدیریتتر تقسیم کند. این کار استراتژیهای حل مسئله انسانی را تقلید میکند، بار شناختی روی مدل را کاهش داده و نرخ توهم (hallucination) را به حداقل میرساند.
تحقیقات نشان دادهاند که پرامپتنویسی CoT میتواند دقت را در معیارهای استدلال پیچیده بیش از ۳۰ درصد بهبود بخشد. این روش به ویژه برای وظایف حسابی، استدلال مبتنی بر常识 (common-sense) و دستکاری نمادین که مسیر رسیدن به راهحل به اندازه خود راهحل مهم است، بسیار مؤثر است.
پیادهسازی زنجیرهای تفکر بدون نمونه (Zero-Shot)
شما همیشه برای بهرهمندی از CoT به نمونههای چندتایی (few-shot) گسترده نیاز ندارید. افزودن یک پرامپت ساده میتواند تواناییهای استدلالی نهفته مدل را فعال کند. موثرترین «عبارت جادویی» اغلب تنها چند کلمهای است که به انتهای دستورالعمل شما اضافه میشود.
تکنیک «بیایید مرحله به مرحله فکر کنیم»
با افزودن یک دستورالعمل ساده، شما معماری ترانسفورمر را مجبور میکنید تا توکنهایی را تولید کند که نمایانگر مراحل استدلال هستند. در اینجا نحوه پیادهسازی این روش در عمل آورده شده است:
# پرامپت پایه
Prompt: "نتیجه 15 * 4 + 10 چیست؟"
# پرامپت زنجیرهای تفکر
Prompt: "نتیجه 15 * 4 + 10 چیست؟ بیایید مرحله به مرحله فکر کنیم."
در مورد اول، مدل ممکن است صرفاً خروجی را حدس بزند. در مورد دوم، احتمالاً تولید خواهد کرد: «اول، باید 15 را در 4 ضرب کنم که میشود 60. سپس، 10 را اضافه میکنم. نتیجه 70 است.» این شکافبندی صریح به مدل اجازه میدهد تا خود را اصلاح کند و انسجام منطقی را تضمین نماید.
پیشرفته: زنجیرهای تفکر با نمونه محدود (Few-Shot)
برای وظایف بسیار پیچیده، مانند اشکالزدایی از کدهای پیچیده یا تحلیل اسناد حقوقی، زنجیرهای تفکر بدون نمونه (zero-shot) ممکن است کافی نباشد. در این سناریوها، ارائه مثالهایی از فرآیند استدلال مطلوب (یادگیری چندتایی) حیاتی است. این تکنیک که اغلب زنجیرهای تفکر با نمونه محدود (Few-Shot Chain of Thought) نامیده میشود، دقیقاً به مدل نشان میدهد که چگونه مسئله را تجزیه کند.
Example 1:
Question: "If a store sells apples for $2 each and oranges for $3 each, how much does it cost to buy 3 apples and 2 oranges?"
Answer: "First, calculate the cost of the apples: 3 apples * $2/apple = $6. Next, calculate the cost of the oranges: 2 oranges * $3/orange = $6. Finally, add the two costs together: $6 + $6 = $12. The total cost is $12."
Example 2:
Question: "Is the following code vulnerable to SQL injection? SELECT * FROM users WHERE id = ' + user_input + ';"
Answer: "To determine if this code is vulnerable, we must look at how user_input is handled. The code concatenates user_input directly into the SQL string without parameterization or escaping. This allows an attacker to inject malicious SQL commands. Therefore, yes, this code is vulnerable to SQL injection."
New Question:
Question: "Explain why the following Python list comprehension is inefficient for large datasets: [x**2 for x in range(1000000)]"
Answer:
بهترین شیوهها برای توسعهدهندگان
- صریح باشید: مراحل مورد نظر خود را برای مدل به وضوح تعریف کنید. دستورالعملهای مبهم منجر به استدلال مبهم میشوند.
- از خروجیهای ساختاریافته استفاده کنید: از مدل بخواهید استدلال خود را در یک قالب خاص (مانند JSON یا لیستهای شمارهگذاری شده) خروجی دهد تا تجزیه آن در برنامه شما آسانتر شود.
- تکرار کنید: اگر مدل شکست خورد، مراحل استدلال آن را تحلیل کنید. اغلب، خطا در تجزیه منطقی نهفته است، نه در محاسبه نهایی.
نتیجهگیری
پرامپتنویسی زنجیرهای تفکر تنها یک ترفند نیست؛ بلکه یک تغییر بنیادین در نحوه تعامل ما با سیستمهای هوش مصنوعی غیرقطعی است. با در نظر گرفتن LLM به عنوان یک موتور استدلال به جای یک موتور تکمیل ساده، توسعهدهندگان میتوانند قابلیت اطمینان و دقت بالاتری را به دست آورند. با ادامه تکامل مدلها، تسلط بر تکنیکهای CoT مهارتی ضروری برای ساخت برنامههای هوش مصنوعی مقاوم و آماده تولید باقی خواهد ماند.