عندما يجيب مساعد متجر بإجابة خاطئة، تبديل النموذج ليس بالضرورة أول إصلاح. ربما المنتج المطلوب غير موجود في الفهرس، أو أن البحث استرجع وصفًا قديمًا، أو أن السؤال يحتاج معلومة لحظية من API. لكي تعرف أين الخلل، افصل خط إدخال المعرفة عن الاسترجاع وعن صياغة الإجابة، ثم اختبر كل جزء بإشارة يمكن قياسها.
ابدأ بأسئلة تمثّل الاستخدام
كوّن مجموعة صغيرة من الأسئلة الحقيقية بعد إزالة البيانات الشخصية: اسم منتج واضح، وصف عام، خطأ إملائي، سؤال عربي مختلط بالإنجليزية، مقارنة، وسؤال لا توجد إجابته. لكل سؤال، دوّن المصدر الصحيح والسلوك المقبول. مثال متجر أحذية: سؤال «حذاء مناسب للمطر بمقاس ٤٢» يحتاج خصائص المنتج وتوفّر المقاس، وليس تشابه الوصف وحده. هذه الحالات أهم من عرض تجريبي ينتقي الأسئلة السهلة.
قسّم المحتوى وفق بنيته
اجعل المنتج أو بند السياسة وحدة مفهومة، واحفظ العنوان والمعرّف واللغة وتاريخ التحديث والعميل ضمن metadata. تقسيم عدد ثابت من الحروف قد يفصل شرط الاسترجاع عن الاستثناء التابع له. في المقابل، مقطع بالغ الطول يجمع مواضيع متباعدة ويستهلك السياق. جرّب أحجامًا وحدودًا مختلفة على مجموعة التقييم نفسها، ولا تعتبر رقمًا واحدًا مناسبًا لكل المحتوى.
افحص النتائج قبل توليد الجواب
سجّل المستندات المسترجعة وترتيبها، ثم اسأل: هل المصدر المطلوب ضمن أول k نتائج؟ وهل النتائج الأخرى مشتّتة أو تابعة لعميل مختلف؟ يمكن تعريف Recall@k كنسبة المصادر المرجعية المطلوبة التي ظهرت ضمن النتائج الأولى. عند وجود مصدر صحيح واحد لكل سؤال، تصبح نسبة الأسئلة التي ظهر فيها ذلك المصدر إشارة بسيطة ومفيدة. أضف مراجعة بشرية للسياق بدل الاكتفاء برقم إجمالي.
ميّز المعرفة الثابتة عن البيانات الحية
سياسة الشحن مناسبة للاسترجاع من مستند مُحدّث. رصيد المخزون وحالة الطلب يحتاجان غالبًا قراءة موثوقة من النظام وقت السؤال. لا تدع النص المسترجع يقرّر صلاحيات الأداة أو يغيّر قواعد المساعد؛ اعتبره بيانات غير موثوقة. قبل استدعاء أداة للطلب، تحقّق من هوية المستخدم وملكية الطلب خارج النموذج.
Question -> tenant-scoped retrieval -> source review
-> authorized live lookup, when needed
-> grounded answer -> evaluation recordقيّم الإجابة والتكلفة كلًا على حدة
راجع صحة الادعاءات، وصحة الاستشهادات، وحالات الامتناع عن الإجابة. وجود رابط لا يثبت أنه يدعم الجملة. سجّل زمن الاسترجاع والتوليد والتكلفة لكل طلب، ثم قارن تغييرًا واحدًا في كل تجربة: التقسيم أو البحث أو الترتيب أو prompt. احتفظ بمجموعة اختبار لم تستخدمها أثناء الضبط حتى لا تتكيّف النتائج مع أمثلة التدريب وحدها.
متى تغيّر النموذج؟
إذا كان السياق الصحيح حاضرًا باستمرار ومع ذلك يفشل النموذج في اتباع التعليمات أو تركيب الإجابة، تصبح مقارنة النماذج خطوة منطقية. أما إذا كان المصدر غائبًا، فالأولوية للفهرسة والاسترجاع. لا توجد طريقة تضمن انعدام الهلوسة؛ الهدف تقليلها وقياسها، مع مسار واضح للتصعيد البشري حين لا تكفي الأدلة.
سيناريو عملي: توصية منتج غير متوفّر
قد ينجح الاسترجاع تمامًا في العثور على حذاء يناسب السؤال، بينما تكون الكمية قد نفدت منذ آخر فهرسة. صنّف هذه الحالة كخلل في حداثة المعلومة أو استخدام الأداة، لا كفشل تشابه دلالي. خزّن ضمن سجل التقييم أي مستند استُرجع، وما الحالة التي أعادها API، وما الذي وصل فعلًا إلى النموذج. هذا التفصيل يوضّح هل تجاهل المساعد معلومة صحيحة أم لم تصله أصلًا.
اختبار تغييرات المعرفة
بعد تعديل سياسة الشحن، اختبر السؤال نفسه قبل إعادة الفهرسة وبعدها، وتحقّق من انتهاء صلاحية النسخة القديمة. أضف حالة حذف منتج وحالة سحب ملف من قاعدة المعرفة. يجب أن تؤدي إزالة المعلومة إلى تغيّر سلوك الإجابة، لا أن تستمر نسخة منسية داخل الكاش أو الفهرس. استخدم جدول مقارنة ثابتًا بين النسخ، وسجّل سبب قبول كل تغيير أو رفضه، حتى لا يتحوّل التقييم إلى انطباع شخصي.
المراجع الرسمية
تدعم هذه المراجع سلوك الأدوات المذكورة. الأمثلة وقرارات التصميم توضيحية، ويجب تكييفها مع متطلبات المشروع وإصداراته.
إعداد: Noor Yasser
تعمل على تحدٍ تقني مشابه؟
أساعد الفرق على تحويل القرار المعماري إلى نطاق واضح وتنفيذ يمكن تشغيله ومراجعته بثقة.




