ما هو تقييم الوكلاء وكيفية اختبار وكلاء الذكاء الاصطناعي؟

أشيش دوبي
قائد تسويق
Published:
May 27, 2026
Updated:
July 7, 2026
What is agent evaluation

يتطور الذكاء الاصطناعي بسرعة، متجاوزًا النماذج البسيطة ذات الدور الواحد إلى وكلاء ذكاء اصطناعي متعدد الخطوات وأكثر تقدمًا يمكنهم التفكير واستخدام الأدوات وإكمال المهام المعقدة بمفردهم. يتطلب هذا التحول نهجًا أكثر ذكاءً للتقييم. 

غالبًا ما يقصر اختبار البرمجيات التقليدي، المصمم للأنظمة ذات المخرجات المتوقعة، عند تقييم الطبيعة التكيفية والأقل قابلية للتنبؤ لوكلاء الذكاء الاصطناعي. يشرح هذا الدليل ماهية تقييم الوكيل، بما في ذلك مفاهيمه الأساسية وأهميته وأساليبه وتحدياته، لمساعدتك في بناء أنظمة ذكاء اصطناعي موثوقة وجديرة بالثقة.

ما هو تقييم الوكيل؟

 Agent evaluation meaning explained

تقييم الوكيل هو عملية منهجية لقياس مدى فعالية أداء وكيل الذكاء الاصطناعي عبر أبعاد متعددة، بما في ذلك قدرته على التفكير والتخزين واتخاذ القرار والتخطيط واستخدام الأدوات وإكمال المهام بشكل عام. ويركز على تقييم كل من المخرجات النهائية والعملية المعقدة متعددة الخطوات التي يقوم بها الوكيل لتحقيق أهدافه.

لماذا يعتبر تقييم الوكيل مهمًا؟

يعتبر تقييم الوكيل مهمًا لأنه يضمن بقاء وكلاء الذكاء الاصطناعي موثوقين وآمنين وذوي قيمة مع انتقالهم من مرحلة التجريب إلى الاستخدام في العالم الحقيقي. على عكس البرمجيات التقليدية، المصممة لإنتاج مخرجات متوقعة، فإن وكلاء الذكاء الاصطناعي احتماليون وتكيفيون، مما يعني أن استجاباتهم وإجراءاتهم يمكن أن تختلف اعتمادًا على السياق والمطالبات والبيانات المتاحة وسير العمل. وهذا يجعل الاختبار المستمر ضروريًا. 

بدون تقييم مناسب، قد ينتج الوكلاء معلومات غير دقيقة، أو يسيئون استخدام الأدوات، أو يكشفون عن بيانات حساسة، أو يفشلون أثناء المهام الحرجة، أو يعملون بكفاءة منخفضة. يمكن أن تؤدي هذه المشكلات إلى تجارب مستخدم سيئة، وتعطيل العمليات، ومخاطر الامتثال، وفقدان الثقة.

يساعد إطار التقييم القوي المؤسسات على اكتشاف المشكلات مبكرًا، ومراقبة الأداء بمرور الوقت، وتحسين الأنظمة بناءً على نتائج قابلة للقياس. كما يتيح للفرق مقارنة الإصدارات، والتحقق من صحة التحديثات، والتأكد من استمرار الوكلاء في تلبية توقعات الأعمال والمستخدمين. 

يحول التقييم المستمر أيضًا عملية التطوير من استكشاف الأخطاء وإصلاحها بشكل تفاعلي إلى عملية جودة استباقية، مما يجعل أنظمة الذكاء الاصطناعي أكثر موثوقية وقابلية للتوسع وجاهزية لبيئات الإنتاج.

اقرأ أيضًا: كيف ينبغي للمؤسسات تقييم بوابة نماذج اللغة الكبيرة (LLM Gateway) من أجل التوسع؟

ما الفرق بين تقييم الوكيل وتقييم نماذج اللغة الكبيرة (LLM)؟

يركز تقييم نماذج اللغة الكبيرة (LLM) على أداء نموذج لغوي كبير مستقل. يقيس مدى جودة النموذج في توليد النصوص استجابة لمطالبة، غالبًا باستخدام مقاييس مثل الدقة الواقعية، والاتساق، والطلاقة، والملاءمة، والمساعدة، والسلامة. 

في معظم الحالات، يتركز التقييم على تفاعل واحد: يتلقى النموذج مدخلات وينتج مخرجات. وهذا يساعد في تقييم القدرة الأساسية للنموذج اللغوي على فهم التعليمات وتوليد استجابات عالية الجودة.

تقييم الوكيل أوسع نطاقًا لأن وكيل الذكاء الاصطناعي هو أكثر من مجرد نموذج لغوي. إنه نظام مدعوم بنموذج لغوي كبير (LLM) يمكنه التفكير والتخطيط واستخدام الأدوات واسترجاع المعلومات واتخاذ الإجراءات لإكمال المهام عبر خطوات متعددة. 

ونتيجة لذلك، يشمل تقييم الوكيل جودة استجابة نموذج اللغة الكبير الأساسي، ولكنه يدرس أيضًا كيفية أداء النظام بأكمله في سيناريوهات حقيقية. وهذا يعني قياس ما إذا كان الوكيل يختار الأدوات الصحيحة، ويستخدمها بشكل صحيح، ويتبع خطوات منطقية، ويتعامل مع الأخطاء، ويتكيف مع الظروف المتغيرة، ويكمل المهمة بنجاح وكفاءة.

بعبارة بسيطة، يقيس تقييم نماذج اللغة الكبيرة (LLM) مدى جودة النموذج في التحدث والتفكير، بينما يقيس تقييم الوكيل مدى جودة النظام بأكمله في التفكير والتصرف وتقديم النتائج. ومع ازدياد استقلالية أنظمة الذكاء الاصطناعي، يصبح تقييم الوكيل أكثر أهمية لأن النجاح لا يعتمد فقط على جودة اللغة، بل على التنفيذ الموثوق للمهام من البداية إلى النهاية.

كيف يعمل تقييم الوكيل؟

تقييم الوكيل هو عملية مستمرة تُستخدم لقياس الأداء، وتحديد المشكلات، وتحسين وكلاء الذكاء الاصطناعي بمرور الوقت. إليك كيفية عملها:

تحديد الأهداف والمقاييس

تبدأ العملية بتحديد معنى النجاح للوكيل. تُحوّل هذه الأهداف إلى مقاييس قابلة للقياس مثل معدل إنجاز المهام، ودقة الأداة، وجودة الاستجابة، والسرعة، والسلامة.

إعداد بيانات التقييم

يتطلب الاختبار الموثوق به مجموعات بيانات قوية. قد تشمل هذه محادثات اصطناعية، وتفاعلات مستخدمين حقيقية مجهولة الهوية، وحالات حافة مختارة بعناية. تستخدم العديد من الفرق أيضًا إجابات مرجعية، أو "ذهبية"، كمعايير.

إجراء التقييمات

يتم بعد ذلك اختبار الوكيل عبر سيناريوهات مختلفة باستخدام فحوصات آلية، ومقيّمين يعتمدون على الذكاء الاصطناعي، ومراجعين بشريين. نظرًا لاحتمال اختلاف المخرجات، غالبًا ما تُستخدم جولات اختبار متعددة لتقييم الاتساق.

مراجعة الأداء

تُحلل النتائج لتحديد الإخفاقات في الاستدلال، أو استخدام الأدوات، أو تنفيذ المهام. تقارن الفرق أيضًا الإصدارات، وتتبع الاتجاهات، وتراجع سجلات المحادثات لفهم أسباب الأخطاء.

تحسين وتكرار

تُستخدم الرؤى المستخلصة من التقييم لتحسين المطالبات، والأدوات، وسير العمل، والمنطق. ثم يُختبر الوكيل المحدّث مرة أخرى، مما يخلق حلقة تغذية راجعة مستمرة تحسن الأداء بمرور الوقت.

اقرأ أيضًا: توحيد مكدس الوكلاء: البوابة التي تجعل أنظمة الوكلاء المتعددة تعمل حقًا

أنواع أساليب تقييم الوكلاء

Agent evaluation approaches

لتقييم وكلاء الذكاء الاصطناعي بدقة، تُستخدم أساليب تقييم مختلفة، يقدم كل منها منظورًا فريدًا لأداء الوكيل. إليك نظرة:

شامل مقابل مستوى المكونات

التقييم الشامل يقيس الأداء الكامل للوكيل من البداية إلى النهاية. ينظر إلى تدفق التنفيذ الكامل، من فهم طلب المستخدم إلى الاستدلال، واستخدام الأدوات، والمخرجات النهائية. الهدف الرئيسي هو تحديد ما إذا كان الوكيل يكمل المهمة بنجاح ويقدم تجربة مستخدم جيدة. يعد هذا النهج ذا قيمة لقياس النتائج الواقعية مثل إنجاز المهام، والدقة، والكفاءة.

التقييم على مستوى المكونات يركز على اختبار الأجزاء الفردية للنظام بشكل منفصل. قد يشمل ذلك تقييم جودة الاستدلال، وأداء الاسترجاع، واستخدام الذاكرة، أو دقة استدعاء الأدوات. عن طريق عزل كل مكون، يمكن للفرق تحديد مكان حدوث الأعطال بسرعة وإجراء تحسينات مستهدفة.

التفاعل الفردي مقابل التفاعلات المتعددة

تقييم التفاعل الفردي يختبر الوكيل باستخدام موجه واحد ويقيس استجابته أو إجراءه الفوري. إنه أبسط وأسرع في التنفيذ، مما يجعله مفيدًا للفحوصات الأساسية أو المهام التي تتطلب تفاعلًا واحدًا فقط.

تقييم التفاعلات المتعددة يقيس مدى جودة أداء الوكيل عبر عدة تفاعلات. يختبر ما إذا كان الوكيل يمكنه الحفاظ على السياق، والتكيف مع المعلومات الجديدة، وإكمال المهام التي تتطلب خطوات متعددة. هذا مهم بشكل خاص لوكلاء دعم العملاء، والبحث، والتخطيط، وأتمتة سير العمل.

التقييم دون اتصال مقابل التقييم عبر الإنترنت

التقييم دون اتصال يتم إجراؤه أثناء التطوير باستخدام مجموعات بيانات مُعدة، ومهام محاكاة، ومقاييس محددة مسبقًا. يُستخدم عادةً لتقييم النماذج، ومقارنة الإصدارات، واختبار التحسينات قبل الإصدار. وهذا يتيح تكرارًا آمنًا وفعالًا دون التأثير على المستخدمين.

التقييم عبر الإنترنت يتم بعد النشر في البيئات الحية. يستخدم سجلات الإنتاج، والتتبعات، وملاحظات المستخدمين، وإشارات الأداء في العالم الحقيقي لمراقبة كيفية تصرف الوكيل بمرور الوقت. يساعد التقييم عبر الإنترنت في اكتشاف الانحراف، والكشف عن الحالات الهامشية، وتحديد المشكلات التي قد تفوتها الاختبارات الخاضعة للتحكم.

ما هي مقاييس التقييم الشائعة لوكلاء الذكاء الاصطناعي؟

يتطلب تقييم وكيل الذكاء الاصطناعي مقاييس متعددة، نظرًا لعدم وجود درجة واحدة تلتقط الأداء العام. يجب أن يكون الوكيل القوي دقيقًا، فعالًا، سهل الاستخدام، موثوقًا به مع الأدوات، وآمنًا.

مقاييس تقييم وكلاء الذكاء الاصطناعي الشائعة تشمل:

مقاييس خاصة بالمهام

تقيّم هذه المقاييس ما إذا كان وكيل الذكاء الاصطناعي يمكنه إكمال هدفه المحدد بنجاح وإنتاج نتائج عالية الجودة.

  • معدل إكمال المهام – النسبة المئوية للمهام التي ينهيها الوكيل بنجاح من البداية إلى النهاية.
  • الدقة / الصحة – ما إذا كانت الاستجابة النهائية صحيحة من الناحية الواقعية ومتوافقة مع نية المستخدم.
  • الاستناد إلى الحقائق – يقيس ما إذا كانت المخرجات مدعومة بالبيانات المسترجعة أو السياق المتاح أو المصادر الموثوقة، مما يساعد على تقليل الهلوسات.
  • معدل النجاح – يتتبع مدى تكرار وصول الوكيل إلى الهدف المنشود.
  • زمن الاستجابة – الوقت المستغرق لإكمال مهمة أو لإرجاع استجابة مفيدة.
  • كفاءة التكلفة – يقيس استخدام الرموز (التوكنات) أو تكلفة الحوسبة أو إنفاق واجهة برمجة التطبيقات (API) لكل مهمة.
  • معدل الخطأ – تكرار الإجراءات الفاشلة أو المخرجات غير الصالحة أو الاستجابات غير المكتملة.

مثال: قد يتم تقييم وكيل دعم العملاء بناءً على عدد التذاكر التي يحلها بشكل صحيح ضمن حدود زمنية مقبولة.

مقاييس التفاعل وتجربة المستخدم

تركز هذه المقاييس على مدى فعالية وكيل الذكاء الاصطناعي في التواصل والتعاون مع المستخدمين.

  • الملاءمة – ما إذا كانت الاستجابات تتطابق مع طلب المستخدم والسياق الحالي.
  • الاتساق – الاتساق المنطقي عبر جولات متعددة في المحادثة.
  • الإيجاز / الكفاءة – القدرة على حل المشكلات دون خطوات غير ضرورية أو إسهاب مفرط.
  • التوجه / النبرة – ما إذا كانت النبرة مناسبة، مثل المهنية، أو المساعدة، أو المتعاطفة.
  • رضا المستخدمين (CSAT) – درجات التقييم المباشرة من المستخدمين بعد التفاعل.
  • معدل التفاعل – مدى تكرار استمرار المستخدمين في استخدام الوكيل أو العودة إليه.
  • درجة الثقة – يقيس ثقة المستخدمين في توصيات الوكيل أو مخرجاته.

مثال: عادة ما يحقق برنامج الدردشة الآلي الذي يحل مشكلات الفواتير في ردين واضحين نتائج أعلى من ذلك الذي يتطلب ستة تبادلات محيرة.

مقاييس استدعاء الدوال

بالنسبة لوكلاء الذكاء الاصطناعي الذين يستخدمون الأدوات، واجهات برمجة التطبيقات (APIs)، قواعد البيانات، أو المكونات الإضافية، تقيّم هذه المقاييس الدقة التشغيلية.

  • دقة اختيار الأداة – مدى تكرار اختيار الوكيل للأداة الصحيحة لمهمة فرعية.
  • صحة الوسائط – ما إذا كانت المعلمات المُنشأة كاملة وصالحة وصحيحة سياقياً.
  • ترتيب استدعاء الأداة – ما إذا كانت الأدوات تُستدعى بالترتيب الصحيح عند وجود تبعيات.
  • معدل نجاح التنفيذ – نسبة استدعاءات الأدوات التي اكتملت دون فشل.
  • معاملات مطلوبة ناقصة – يكشف عن المدخلات المحذوفة المطلوبة لدالة.
  • نوع المعامل الخاطئ – تمرير أنواع بيانات غير صحيحة مثل النص بدلاً من الأرقام.
  • معاملات متوهمة – تضمين معاملات غير مدعومة وغير معرفة في مخطط الأداة.

مثال: قد يختار مساعد السفر واجهة برمجة التطبيقات الصحيحة للحجز، لكنه يفشل إذا نسي تضمين تواريخ المغادرة.

تقييم المسار الحركي والمسار

تحلل هذه المقاييس كيفية وصول الوكيل إلى إجابة، خاصة في أنظمة التخطيط والاستدلال متعددة الخطوات.

  • جودة الخطة – ما إذا كانت الخطة المولدة منطقية وكاملة وفعالة.
  • الالتزام بالخطة – يقيس ما إذا كان الوكيل يتبع خطته المقترحة الخاصة به أثناء التنفيذ.
  • كفاءة الخطوة – ما إذا كانت المهام تكتمل باستخدام الحد الأدنى من الخطوات الضرورية.
  • التقارب – ما إذا كان استدلال الوكيل يتقارب بكفاءة وكيف نحو حل صحيح، بدلاً من التكرار أو التباعد.
  • معدل التكرار – تكرار الإجراءات المتكررة أو غير الضرورية.
  • القدرة على التعافي – مدى فعالية تعامل الوكيل مع الأخطاء وإعادة التوجيه.

مثال: إذا استغرق الوكيل عشر استدعاءات لأدوات لحل مهمة تتطلب عادةً ثلاثة، فقد يكون مسار استدلاله غير فعال.

مقاييس الذكاء الاصطناعي الأخلاقي والمسؤول

تضمن هذه المقاييس أن يتصرف وكيل الذكاء الاصطناعي بأمان وعدالة، وبما يتوافق مع القواعد ومعايير الخصوصية.

  • اكتشاف التحيز – يحدد المخرجات غير العادلة أو المتحيزة عبر المجموعات المختلفة.
  • معالجة معلومات التعريف الشخصية (PII) – يضمن إخفاء معلومات التعريف الشخصية أو حمايتها أو معالجتها وفقًا لسياسات الخصوصية.
  • المتانة / معالجة الأخطاء – يقيس الأداء في ظل المدخلات المشوشة أو الغموض أو أعطال الأدوات.
  • مقاومة الاختراق الأمني – يقيم مدى المقاومة للمطالبات الضارة التي تحاول تجاوز ضوابط الأمان.
  • معدل الالتزام بالسياسات – نسبة المخرجات التي تتوافق مع المعايير التنظيمية أو القانونية.
  • معدل الهلوسة – تكرار الحقائق الملفقة أو الادعاءات غير المدعومة.
  • معدل السمية – وجود لغة ضارة أو مسيئة أو عدوانية.

مثال: يجب على مساعد الذكاء الاصطناعي في الرعاية الصحية تجنب تسريب البيانات الخاصة مع تقديم استجابات آمنة طبيًا ومتوافقة مع السياسات.

اقرأ أيضاً: نظام متعدد الوكلاء مع MCP: قصة نجاح مبيعات توضيحية

كيف تصمم مهام تقييم الوكيل؟

يبدأ تصميم مهام تقييم الوكيل الفعالة بفهم واضح لغرض الوكيل وسلوكه المتوقع. ابدأ بتحديد معايير نجاح واضحة لكل مهمة حتى يتمكن المقيمون من تحديد ما إذا كان الوكيل ينجح أو يفشل بشكل متسق.

استخدم سيناريوهات واقعية عند بناء المهام، بما في ذلك طلبات المستخدم الشائعة، وحالات الحافة، وإخفاقات الإنتاج السابقة. يساعد تحويل تقارير الأخطاء أو التفاعلات الفاشلة إلى حالات اختبار في ضمان أن يعكس التقييم أنماط الاستخدام الفعلية.

أنشئ مجموعة مهام متوازنة تتضمن حالات إيجابية وسلبية. على سبيل المثال، يجب اختبار وكيل البحث على الاستعلامات التي تتطلب بحثًا عبر الويب بالإضافة إلى الاستعلامات التي يجب الإجابة عليها دون استخدام أدوات البحث. يساعد هذا في اكتشاف الإفراط في استخدام الأدوات أو التقصير في استخدامها.

لكل مهمة، قم بإعداد مخرجات مرجعية أو "ذهبية". تؤكد هذه الإجابات الصحيحة المعروفة أن المهمة قابلة للحل وتساعد في التحقق من أن المقيمين يعملون بشكل صحيح. إذا فشلت العديد من عمليات التشغيل بشكل غير متوقع، فقد تكون المشكلة في تصميم المهمة بدلاً من الوكيل.

أخيرًا، قم بتحسين مجموعة التقييم باستمرار بناءً على النتائج، وملاحظات المستخدمين، وحالات الفشل الجديدة حتى تظل ذات صلة وتقيس أداء الوكيل الحقيقي بدقة.

ما هي التحديات في تقييم الوكيل؟

يقدم تقييم وكلاء الذكاء الاصطناعي تحديات فريدة تميزه عن اختبار البرمجيات التقليدي:

خلافات المقيمين والإيجابيات الكاذبة: قد تنتج وكلاء الذكاء الاصطناعي حلولًا صحيحة تختلف عن الإجابات المتوقعة المحددة مسبقًا. يمكن للمراجعين البشريين أو المقيمين المعتمدين على نماذج اللغة الكبيرة (LLM) وصف هذه الاستجابات بالخطأ على أنها إخفاقات، مما يخلق إيجابيات كاذبة. وهذا يجعل من المهم معايرة أنظمة التقييم بعناية وصقل معايير التقييم بانتظام.

حالات الحافة والخصومة: غالبًا ما يواجه الوكلاء مدخلات غير واضحة أو غير متوقعة أو ضارة في بيئات العالم الحقيقي. تشمل الأمثلة التعليمات الغامضة، ومحاولات حقن الأوامر، والطلبات المتضاربة. يعد تصميم مهام تقييم تغطي هذه السيناريوهات أمرًا صعبًا ولكنه ضروري لضمان المتانة والسلامة.

الحفاظ على الصلة بمرور الوقت: تتطور نماذج الذكاء الاصطناعي، وسير عمل الوكلاء، وسلوك المستخدمين بسرعة. قد تصبح مجموعة الاختبار التي تعمل اليوم قديمة مع تحسن القدرات أو ظهور مخاطر جديدة. يجب تحديث أطر التقييم باستمرار بسيناريوهات جديدة، وملاحظات من الإنتاج، وحالات فشل جديدة.

تصحيح أخطاء الفشل متعدد الخطوات: غالبًا ما يكون تتبع أخطاء الوكيل صعبًا لأن الإخفاقات قد تبدأ مبكرًا في سير العمل وتظهر لاحقًا فقط. يمكن أن يؤثر قرار خاطئ في خطوة واحدة على جميع الخطوات التالية. يتطلب تشخيص هذه المشكلات أدوات تسجيل وتتبع ومراقبة قوية خطوة بخطوة.

الخاتمة

تقييم الوكلاء هو أكثر من مجرد فحص جودة، إنه ضروري لبناء وكلاء ذكاء اصطناعي موثوقين ويمكن الاعتماد عليهم وعاليي الأداء. مع ازدياد استقلالية الوكلاء وتوليهم مهام معقدة، من المهم قياس قدرتهم على التفكير، واستخدام الأدوات، وأدائهم العام. 

من خلال استخدام أساليب تقييم واضحة، ومقاييس مفيدة، وملاحظات مستمرة، يمكن للمؤسسات نشر وكلاء الذكاء الاصطناعي بثقة أكبر، وتقليل المخاطر، وخلق قيمة تجارية حقيقية. يساعد التقييم القوي على ضمان استخدام الذكاء الاصطناعي بمسؤولية وفعالية.

TrueFoundry يسهّل هذه العملية من خلال مساعدة الفرق على بناء ونشر وتقييم وكلاء الذكاء الاصطناعي على نطاق واسع. مع إمكانية المراقبة المدمجة و بوابة الذكاء الاصطناعي للوصول الآمن للنماذج، يمكن للفرق إدارة النشر والمراقبة وتحسين الأداء في مكان واحد.

هل ترغب في إطلاق وكلاء الذكاء الاصطناعي في بيئة الإنتاج بثقة؟ احجز عرضًا توضيحيًا لترى كيف تساعد TrueFoundry الفرق على البناء والتقييم والتوسع بشكل أسرع. 

1. Lorem ipsum dolor sit amet
Lorem ipsum dolor sit amet, consectetur adipiscing elit, sed do eiusmod tempor incididunt ut labore et dolore magna aliqua. Ut enim ad minim veniam, 
2. Lorem ipsum dolor sit amet
Lorem ipsum dolor sit amet, consectetur adipiscing elit, sed do eiusmod tempor incididunt ut labore et dolore magna aliqua. Ut enim ad minim veniam, 
3. Lorem ipsum dolor sit amet
Lorem ipsum dolor sit amet, consectetur adipiscing elit, sed do eiusmod tempor incididunt ut labore et dolore magna aliqua. Ut enim ad minim veniam, 
Table of Contents

Govern, Deploy and Trace AI in Your Own Infrastructure

Book a 30-min with our AI expert

Book a Demo

Frequently Asked Questions

ما هو تقييم الوكيل؟

تقييم الوكيل هو عملية منظمة لقياس مدى كفاءة أداء وكيل الذكاء الاصطناعي للمهام. وهي تفحص جوانب الاستنتاج، واتخاذ القرار، واستخدام الأدوات، وجودة الاستجابة، والموثوقية، وإتمام المهام عبر سير العمل متعدد الخطوات. الهدف من ذلك هو ضمان عمل الوكيل بدقة وكفاءة وأمان واتساق في سيناريوهات العالم الحقيقي.

كيف تقيّم أداء الوكيل؟

تبدأ عملية تقييم الوكيل بتحديد معايير نجاح واضحة وإنشاء سيناريوهات اختبار واقعية. يتم قياس الأداء باستخدام الفحوصات الآلية، والتقييم القائم على النماذج اللغوية الكبيرة (LLM)، والمراجعة البشرية. تُحلل النتائج لتحديد نقاط الضعف، ثم يتم تحسين الوكيل بشكل مستمر من خلال تعديل الأوامر (prompts)، أو الأدوات، أو سير العمل، أو تطوير النموذج.

ما الفرق بين تقييم نماذج اللغة الكبيرة (LLM) وتقييم الوكلاء؟

يركز تقييم نماذج اللغة الكبيرة (LLM) على القدرات المستقلة للنموذج، مثل الدقة، والطلاقة، والملاءمة، وصحة المعلومات. أما تقييم الوكلاء فهو أوسع نطاقاً، حيث يقيس النظام بالكامل، بما في ذلك خطوات التفكير، والذاكرة، والتخطيط، واستخدام الأدوات، وتنفيذ سير العمل، والنجاح في إتمام المهام متعددة الخطوات في بيئات ديناميكية.

Grey wavy lines on white background, abstract wave pattern with multiple curved lines intersecting smoothly.

GenAI infra- simple, faster, cheaper

Trusted by Top Teams to Scale GenAI