بازگشت به بلاگ
مهندسی ایجنت۱۴۰۵/۰۶/۱۴۱۲ دقیقه

Agent Evaluation چیست و چگونه Agent را ارزیابی کنیم؟

Agent Evaluation چیست؟ چرا بدون ارزیابی، Agent فقط دمو است؛ متریک‌ها، روش‌های ارزیابی، چک‌لیست production و مسیر تبدیل Agent به سیستم قابل اعتماد.

Agent Evaluation چیست و چگونه Agent را ارزیابی کنیم؟

ساخت یک AI Agent که در Demo خوب کار کند، دیگر سخت‌ترین بخش ماجرا نیست. سخت‌تر این است که بفهمید: آیا می‌توان به این سیستم در محیط واقعی اعتماد کرد؟

فرض کنید Agent پشتیبانی در ۲۰ نمونه آزمایشی ۱۸ بار پاسخ درست داده است. هنوز نمی‌دانید در دو خطای باقی‌مانده آیا فقط لحن ضعیف بوده، یا سفارش اشتباه لغو شده است. همین تفاوت، اهمیت Agent Evaluation را نشان می‌دهد.

Evaluation یعنی اندازه‌گیری رفتار سیستم در مسیر، نه فقط قضاوت درباره جمله آخر.

در این مقاله می‌بینیم Agent Evaluation چیست، چرا ضروری است، چه معیارها و روش‌هایی کاربردی‌اند، در Production چگونه پایدار می‌ماند و یک چک‌لیست عملی برای شروع چیست.

Agent Evaluation چیست؟

Agent Evaluation فرآیند طراحی سناریو، معیار و بازخورد برای سنجش کیفیت تصمیم‌گیری، استفاده از ابزار و نتیجه نهایی Agent است.

برخلاف ارزیابی یک پاسخ تکی، در Agent معمولاً چند لایه را همزمان می‌سنجیم:

آیا هدف کاربر درست فهمیده شد؟
آیا ابزار درست انتخاب شد؟
آیا پارامترها معتبر بودند؟
آیا قوانین کسب‌وکار رعایت شد؟
آیا در خطا بازیابی کرد؟
آیا خروجی نهایی قابل اتکا است؟

به همین دلیل Evaluation بخشی از مهندسی ایجنت است، نه یک تست اختیاری انتهای پروژه.

چرا Evaluation برای Agent حیاتی است؟

مسیر پنهان

ممکن است پاسخ نهایی درست به نظر برسد ولی Agent از مسیر اشتباه یا Tool غیرضروری گذشته باشد.

ریسک اقدام

Agent فقط متن تولید نمی‌کند؛ گاهی داده می‌نویسد، ایمیل می‌فرستد یا وضعیت را تغییر می‌دهد.

پسرفت بی‌صدا

با تغییر Prompt، مدل یا Tool، کیفیت ممکن است بدون اطلاع تیم افت کند.

بدون Eval، تیم‌ها معمولاً با احساس و نمونه‌های پراکنده تصمیم می‌گیرند. با Eval، حداقل یک زبان مشترک برای «بهتر شد / بدتر شد» دارید.

معیارهای کاربردی

به‌جای یک عدد جادویی، مجموعه‌ای از معیارهای متناسب با مسئله بسازید:

Task Success

آیا هدف کاربر در نهایت محقق شد؟ (مثلاً وضعیت سفارش درست گزارش شد و اقدام مجاز انجام گرفت.)

Tool Selection Quality

آیا ابزار درست در زمان درست انتخاب شد؟ فراخوانی‌های اضافه یا اشتباه ثبت شوند.

Policy / Guardrail Compliance

آیا Agent از محدودیت‌ها تخطی کرد؟ مثلاً تخفیف غیرمجاز یا افشای داده.

Human Escalation Appropriateness

آیا موارد مبهم/پرریسک به‌درستی به انسان ارجاع شد؟ نه زیاد و نه کم.

Efficiency

تعداد گام‌ها، توکن مصرفی و Latency در محدوده قابل قبول بودند؟

Robustness

با ورودی ناقص، خطای Tool یا داده متناقض چه کرد؟

معیار خوب باید به تصمیم محصول وصل باشد: اگر این عدد بد شود، آیا واقعاً تجربه کاربر یا ریسک کسب‌وکار بدتر می‌شود؟

روش‌های ارزیابی

یک پشته Eval عملی معمولاً چند لایه دارد:

Golden Set دستی

سناریوهای برچسب‌خورده توسط انسان با نتیجه مورد انتظار و نکات Pass/Fail.

Assertionهای قطعی

بررسی‌های قابل‌اتوماسیون: JSON معتبر، فیلد اجباری، عدم فراخوانی Tool ممنوع.

Trajectory Review

بازبینی مسیر تصمیم: ترتیب Toolها، فرضیات و نقاط انحراف.

Judge کمکی (با احتیاط)

استفاده از مدل یا چک‌لیست برای امتیازدهی کیفی—همیشه با نمونه انسانی کالیبره شود.

ترتیب پیشنهادی
تعریف موفقیت۱۰ سناریو واقعیAssertion قطعیبازبینی مسیرگسترش مجموعهمانیتورینگ

از روز اول دنبال Benchmark عظیم نباشید. یک مجموعه کوچک ولی نزدیک به واقعیت، بهتر از صدها نمونه ساختگی است.

از Demo تا اعتماد

Evaluation را بخشی از مسیر ساخت Agent کن

در بوت‌کمپ مهندسی ایجنت تنسوا، طراحی سناریو، معیار و حلقه بهبود Agent را کنار معماری و Tool Calling تمرین می‌کنی.

Evaluation در Production

Eval قبل از انتشار کافی نیست. در محیط واقعی باید حلقه مشاهده و بهبود داشته باشید:

  1. 1لاگ ساختاریافته از ورودی، Tool Callها، نتایج و تصمیم نهایی نگه دارید (با رعایت حریم خصوصی).
  2. 2نمونه‌های شکست را دسته‌بندی کنید: فهم اشتباه، Tool غلط، Policy، کمبود Context.
  3. 3برای هر دسته، حداقل یک تست رگرسیون به مجموعه Eval اضافه کنید.
  4. 4قبل از تغییر Prompt/مدل/Tool، همان مجموعه را دوباره اجرا کنید.
  5. 5برای اقدامات پرریسک، Human-in-the-loop و نرخ تأیید/رد را مانیتور کنید.
  6. 6آستانه‌های هشدار تعریف کنید: مثلاً افزایش ناگهانی Escalation یا خطای Tool.

Production Eval یعنی سیستم یاد می‌گیرد کجا می‌شکند—قبل از اینکه کاربر همان شکست را بارها تجربه کند.

چک‌لیست شروع

هدف Agent را در یک جمله قابل‌اندازه‌گیری بنویسید
اقدامات مجاز / ممنوع را لیست کنید
۱۰ سناریوی شاد و ۵ سناریوی لبه‌ای بسازید
برای هر سناریو Pass/Fail عینی تعریف کنید
مسیر Tool مورد انتظار را مشخص کنید (در صورت نیاز)
حداقل یک سناریوی داده ناقص و یک سناریوی متناقض داشته باشید
نمونه شکست را بعد از هر تغییر بررسی کنید
مالک Eval در تیم مشخص باشد

اگر نمی‌توانید بگویید «این نسخه بهتر شد چون روی مجموعه X از Y به Z رسید»، هنوز Eval ندارید؛ فقط احساس پیشرفت دارید.

جمع‌بندی

Agent بدون Evaluation مثل محصول بدون تست است: ممکن است در شرایط ایده‌آل بدرخشد و در اولین استثنای واقعی بشکند. Eval را از روزهای اول کوچک شروع کنید و با رشد سیستم بزرگش کنید.

اگر تازه با مفهوم AI Agent آشنا شده‌اید، Evaluation را هم‌زمان با معماری و Toolها در مسیر یادگیری قرار دهید—نه به‌عنوان مرحله آخر.

تعریف موفقیتسناریو واقعیمعیار چندلایهبازبینی مسیررگرسیونمانیتورینگ

سوالات متداول

Agent Evaluation چیست؟+

Agent Evaluation مجموعه‌ای از روش‌ها برای سنجش کیفیت تصمیم، انتخاب ابزار، رعایت قوانین و نتیجه نهایی یک AI Agent در سناریوهای واقعی یا شبیه‌سازی‌شده است.

چرا ارزیابی Agent سخت‌تر از ارزیابی یک پاسخ LLM است؟+

چون Agent چندمرحله‌ای است، از ابزار استفاده می‌کند، مسیرش می‌تواند شاخه شود و خطای میانی ممکن است تا انتها پنهان بماند. فقط درست بودن متن نهایی کافی نیست.

از کجا Evaluation را شروع کنیم؟+

با ۱۰–۲۰ سناریوی واقعی شروع کنید: ورودی، Context، ابزارهای مجاز، نتیجه مورد انتظار و معیار Pass/Fail. سپس به‌تدریج مجموعه را گسترش دهید.

آیا Accuracy تنها معیار مهم است؟+

خیر. برای سیستم واقعی باید Tool Selection، رعایت Permission، هزینه/Latency، قابلیت بازیابی از خطا و نیاز به دخالت انسان را هم بسنجید.

Evaluation چه ربطی به مسیر یادگیری Agent دارد؟+

بدون Eval، فقط Demo می‌سازید. Evaluation همان مهارتی است که Demo را از سیستم قابل‌اعتماد جدا می‌کند و در مسیر مهندسی ایجنت ضروری است.

اعتماد با اندازه‌گیری

می‌خواهی Agent قابل ارزیابی بسازی؟

در بوت‌کمپ مهندسی ایجنت تنسوا، Evaluation را کنار معماری، Tool Calling و Guardrail پروژه‌محور یاد می‌گیری. پیش‌ثبت‌نام رایگان است.

از خواندن تا ساختن

می‌خواهی مسیر AI Agent Engineer را شروع کنی؟

در بوت‌کمپ مهندسی ایجنت تنسوا، از معماری و Tool Calling تا Context Engineering، MCP، Guardrail و Evaluation را پروژه‌محور یاد می‌گیری. پیش‌ثبت‌نام رایگان است.