پاسخ خوب همیشه به معنی کار درست نیست
عامل هوشمند ممکن است توضیحی قانعکننده بنویسد، اما فایل اشتباه را تغییر داده یا مرحلهای ضروری را کنار گذاشته باشد. در ارزیابی عامل، نتیجه واقعی کار و مسیر استفاده از ابزار هر دو اهمیت دارند. راهنمای مهندسی Anthropic میان ارزیابی با کد، مدل و انسان تفاوت میگذارد و انتخاب روش را به نوع وظیفه وابسته میداند.
برای خروجی قابل سنجش، آزمون ماشینی میتواند شرایط مشخصی را بررسی کند. قضاوت درباره کیفیت متن به معیار روشن و گاهی داوری انسانی نیاز دارد. داور مبتنی بر مدل نیز باید با نمونههای انسانی تنظیم و بررسی شود. تکیه بر یک نمره کلی ممکن است اختلاف میان دقت، رعایت محدودیت و کیفیت نگارش را پنهان کند.
آزمونهایی شبیه کار روزمره
پیشنهاد عملی، جمعآوری نمونه از درخواستهای واقعی واحد مربوط است. در یک فرایند پشتیبانی، تنها پاسخهای آسان کافی نیستند؛ درخواست ناقص، مشتری تکراری، نبود اطلاعات و قطع موقت ابزار هم باید حضور داشته باشند. برای هر نمونه، نتیجه مورد انتظار و رفتار پذیرفتنی در شرایط خطا را از قبل بنویسید.
محیط آزمون باید روشن و قابل تکرار باشد. اگر داده آزمایشی تغییر کند یا نتیجه مطلوب فقط در ذهن ارزیاب باشد، مقایسه نسخهها اعتبار خود را از دست میدهد. بهتر است نمونههای توسعه از نمونههای ارزیابی نهایی جدا بمانند تا تیم صرفاً دستور عامل را برای چند سؤال شناختهشده تنظیم نکند.
موفقیت را همراه با هزینه و زمان بررسی کنید. عاملی که کار را درست اما با تکرارهای فراوان انجام میدهد، ممکن است برای استفاده روزانه مناسب نباشد. خطاها را نیز به گروههای مشخص، مانند بازیابی ضعیف، انتخاب ابزار نادرست و نبود داده تقسیم کنید تا اصلاح بعدی به علت واقعی نزدیک شود.
نمونه طرح ارزیابی یک عامل
این پیکربندی آموزشی، شکل یک مورد آزمون را نشان میدهد و به چارچوب خاصی وابسته نیست. معیارهای قابل اندازهگیری باید با محیط آزمایش واقعی پیادهسازی شوند.
task:
id: policy-answer-01
input: "Summarize the approved leave policy."
expected_outcome:
source_cited: true
records_changed: false
graders:
- citation_support
- no_write_tool_calls
- final_state_checkموفقیت فقط متن پاسخ نیست: ارجاع باید معتبر باشد و عامل نباید ابزار تغییر داده را فراخوانی کرده باشد.
نتیجه را قابل پیگیری نگه دارید
پیش از هر تغییر مهم، همان مجموعه ثابت را اجرا و افت کیفیت را بررسی کنید. نمونههای تازه از خطاهای واقعی را بهتدریج اضافه کنید و برای هر نتیجه، نسخه مدل و ابزار را ثبت کنید. این روال ارزیابی را به بخشی از نگهداری محصول تبدیل میکند.
توضیحها و پیشنهادهای اجرایی این مطلب، تحلیل تحریریه دانشنامه لیان هستند.منابع: Anthropic Engineering — Demystifying Evals for AI Agents
این مطلب بازنویسی تحلیلی دانشنامه لیان بر پایه منبع اصلی است.مشاهده منبع اصلی




