پاسخ خوب همیشه به معنی کار درست نیست

عامل هوشمند ممکن است توضیحی قانع‌کننده بنویسد، اما فایل اشتباه را تغییر داده یا مرحله‌ای ضروری را کنار گذاشته باشد. در ارزیابی عامل، نتیجه واقعی کار و مسیر استفاده از ابزار هر دو اهمیت دارند. راهنمای مهندسی Anthropic میان ارزیابی با کد، مدل و انسان تفاوت می‌گذارد و انتخاب روش را به نوع وظیفه وابسته می‌داند.

برای خروجی قابل سنجش، آزمون ماشینی می‌تواند شرایط مشخصی را بررسی کند. قضاوت درباره کیفیت متن به معیار روشن و گاهی داوری انسانی نیاز دارد. داور مبتنی بر مدل نیز باید با نمونه‌های انسانی تنظیم و بررسی شود. تکیه بر یک نمره کلی ممکن است اختلاف میان دقت، رعایت محدودیت و کیفیت نگارش را پنهان کند.

آزمون‌هایی شبیه کار روزمره

پیشنهاد عملی، جمع‌آوری نمونه از درخواست‌های واقعی واحد مربوط است. در یک فرایند پشتیبانی، تنها پاسخ‌های آسان کافی نیستند؛ درخواست ناقص، مشتری تکراری، نبود اطلاعات و قطع موقت ابزار هم باید حضور داشته باشند. برای هر نمونه، نتیجه مورد انتظار و رفتار پذیرفتنی در شرایط خطا را از قبل بنویسید.

محیط آزمون باید روشن و قابل تکرار باشد. اگر داده آزمایشی تغییر کند یا نتیجه مطلوب فقط در ذهن ارزیاب باشد، مقایسه نسخه‌ها اعتبار خود را از دست می‌دهد. بهتر است نمونه‌های توسعه از نمونه‌های ارزیابی نهایی جدا بمانند تا تیم صرفاً دستور عامل را برای چند سؤال شناخته‌شده تنظیم نکند.

موفقیت را همراه با هزینه و زمان بررسی کنید. عاملی که کار را درست اما با تکرارهای فراوان انجام می‌دهد، ممکن است برای استفاده روزانه مناسب نباشد. خطاها را نیز به گروه‌های مشخص، مانند بازیابی ضعیف، انتخاب ابزار نادرست و نبود داده تقسیم کنید تا اصلاح بعدی به علت واقعی نزدیک شود.

نمونه طرح ارزیابی یک عامل

این پیکربندی آموزشی، شکل یک مورد آزمون را نشان می‌دهد و به چارچوب خاصی وابسته نیست. معیارهای قابل اندازه‌گیری باید با محیط آزمایش واقعی پیاده‌سازی شوند.

پرسش، نتیجه مورد انتظار و معیارهای بررسی
task:
  id: policy-answer-01
  input: "Summarize the approved leave policy."
  expected_outcome:
    source_cited: true
    records_changed: false
  graders:
    - citation_support
    - no_write_tool_calls
    - final_state_check

موفقیت فقط متن پاسخ نیست: ارجاع باید معتبر باشد و عامل نباید ابزار تغییر داده را فراخوانی کرده باشد.

نتیجه را قابل پیگیری نگه دارید

پیش از هر تغییر مهم، همان مجموعه ثابت را اجرا و افت کیفیت را بررسی کنید. نمونه‌های تازه از خطاهای واقعی را به‌تدریج اضافه کنید و برای هر نتیجه، نسخه مدل و ابزار را ثبت کنید. این روال ارزیابی را به بخشی از نگهداری محصول تبدیل می‌کند.

توضیح‌ها و پیشنهادهای اجرایی این مطلب، تحلیل تحریریه دانشنامه لیان هستند.منابع: Anthropic Engineering — Demystifying Evals for AI Agents

این مطلب بازنویسی تحلیلی دانشنامه لیان بر پایه منبع اصلی است.مشاهده منبع اصلی