الـ eval harness (منظومة اختبار جودة الذكاء الاصطناعي) هو أكثر أجزاء أي نظام ذكاء اصطناعي بخسًا لحقه. وهو الفارق بين أن تطوّر بثقة وأن تُطلق الـ prompts اعتمادًا على الانطباع.
ابدأ بالسلوك الذي تريده، لا بالمؤشر. «يجب أن يرفض روبوت المحادثة الأسئلة الخارجة عن نطاقه بلباقة» سلوك. أما «دقة 90% على مجموعة الاختبار» فمؤشر. والمؤشر لا يعني شيئًا إلا بعد أن يُحدَّد السلوك تحديدًا دقيقًا.
ابنِ أول 100 مثال في مجموعة البيانات يدويًا. نستخدم Excel أو Notion أو Linear — أي أداة يكتب فيها الفريق أصلًا. نضع تسميات للمدخلات وللمخرجات المتوقعة، ونضع على كل مثال وسمًا يحدد السلوك الذي يختبره.
ثم وسّع المجموعة إلى 500–2,000 مثال عبر التوليد الاصطناعي، مع مراجعة بشرية لكل مثال مولَّد. مجموعات الاختبار المولَّدة آليًا بالكامل تنجرف نحو تحيّز المولّد أيًّا كان — والمراجعة البشرية هي المصحّح.
شغّل الاختبار عند كل تغيير في الـ prompt، وكل تغيير في الاسترجاع، وكل تغيير في النموذج. قيّم آليًا حيثما أمكن، ويدويًا حيثما وجب. وتابع النتائج عبر الزمن حتى تلتقط أي تراجع مبكرًا.
منظومة الاختبار هي أيضًا بوابة الجاهزية للإطلاق. نحن لا نطلق على حركة المستخدمين الحقيقيين حتى تتجاوز درجات الاختبار العتبة التي اتفقنا عليها مع العميل في الأسبوع الأول.
ذكاء اصطناعي بلا اختبارات هو برمجيات بلا اختبارات. أحيانًا ينجح، وكثيرًا لا ينجح. ولن تعرف حتى يخبرك عملاؤك، وعندها يكون قد كلّفك شيئًا بالفعل.
بقلم فريق brainiac/studio. ننشر أعمالًا أصلية يكتبها المهندسون والمصممون والمسوّقون الذين ينفّذون العمل بأنفسهم — ولا نُسندها أبدًا إلى مصنع محتوى.