الذكاء الاصطناعي · أصل المحتوى

textGrain من OpenAI: ما الذي تثبته العلامة المائية للنص وما الذي لا تثبته

أتاحت OpenAI العلامة المائية للنص اختياريًا لنماذج API محددة. يشرح الدليل textGrain وحدود الكشف ومعمارية Provenance آمنة.

المسار المرتبطالذكاء الاصطناعي وRAG والبحث المتجهي
رسم تحريري تصوري لتدفق Tokens يكتسب نمطًا إحصائيًا تحت عدسة كشف بجوار ختم Provenance منفصل للوسائط؛ وليس واجهة OpenAI أو دليل كشف حقيقي.
تصوّر بصري للفكرة — يتبعه شرح ومخطط تنفيذي داخل المقال.

أعلنت OpenAI في 5 أكتوبر 2026 إتاحة العلامة المائية غير المرئية للنص كخيار لعملاء API عالميًا على نماذج محددة، مع بقائها معطلة افتراضيًا. تعتمد الطريقة المسماة textGrain على تعديل أخذ عينات Tokens لإضافة إشارة إحصائية يستطيع Detector مخوّل اختبارها. تفيد هذه الإشارة كدليل ضمن منظومة Provenance وإفصاح، لكنها لا تثبت التأليف أو الحقيقة أو الملكية أو الالتزام بالسياسات. في الإنتاج يجب حفظ سجل التوليد، وإظهار Disclosure في المنتج، وقياس أخطاء الكشف على المحتوى الفعلي، والإبقاء على المراجعة البشرية في القرارات المؤثرة.

يفصل هذا المقال بين الحقائق الموثقة والتوصيات الهندسية. تم التحقق في 6 أكتوبر 2026 من إعلان OpenAI والتقرير التقني ووثائق API ومركز المساعدة؛ أما معمارية الإطلاق والبوابات التشغيلية أدناه فهي تحليل هندسي وليست وصفًا لبنية OpenAI الداخلية.

ما الجديد في 5 أكتوبر؟

يقول إعلان OpenAI الرسمي إن عملاء API يستطيعون الاشتراك اختياريًا في Text Watermarking على نماذج محددة عالميًا، وإن الخيار يبقى مغلقًا افتراضيًا. كما أعلنت الشركة أنها ستضيف العلامة غير المرئية خلال الأسابيع التالية إلى مخرجات ChatGPT وCodex المؤهلة داخل الاتحاد الأوروبي. أما الوصول إلى Text Detector فمقيد مبدئيًا بباحثين وجهات متخصصة معتمدة.

هذه ثلاثة أسطح مختلفة وليست Detector عالميًا واحدًا: توليد عبر نماذج API مدعومة، وإطلاق إقليمي في ChatGPT وCodex، ووصول مضبوط لأداة كشف النص. لا يجوز استنتاج أن كل رد من OpenAI يحمل Watermark، أو أن نموذجًا غير مدعوم يحملها، أو أن Endpoint عامًا لفحص النص متاح للجميع.

يحمل الإعلان تاريخ 5 أكتوبر 2026 ويربط الإطلاق بمتطلبات Provenance للنص في EU AI Act. هذا يشرح سياق الإطلاق، لكن السؤال الهندسي أضيق: ما نوع الدليل الذي توفره الإشارة؟ كم تضعف مع التحرير؟ وأين تدخل في قرار إنتاجي؟

كيف تضيف textGrain الإشارة؟

يصف تقرير textGrain التقني التوليد كاقتران مضبوط بالـEntropy بين احتمالات Next Token وعشوائية Pseudorandom مرتبطة بمفتاح سري. في كل خطوة تُقسم Tokens إلى Vocabulary Blocks محسوبة من المفتاح. تختار Optimal Transport اقترانًا يصنع اعتمادًا قابلًا للكشف، بينما تحد عقوبة Kullback–Leibler من مقدار Sampling Entropy المفقود. وداخل Block المختار تبقى الاحتمالات النسبية للـTokens محفوظة.

الفكرة العملية هي وجود ميزانية. إذا لم تعتمد العينة على العشوائية المرتبطة بالمفتاح فلن توجد إشارة تكشف. وإذا تحكم المفتاح أكثر من اللازم فقد تقل مرونة النص وجودته. تستهدف textGrain حدًا متوسطًا لفقدان Entropy، فتصبح قوة Watermark ذات معنى Information-Theoretic بدل أن تكون مجرد انحياز عشوائي لقائمة كلمات.

صممت الطريقة بحيث يعيد المتوسط عبر المفاتيح توزيع Next Token الأصلي ضمن افتراضات التقرير. هذا لا يعني أن سلوك كل مفتاح ثابت متطابق، ولا أن Numerical Solver يضمن نفس مقدار الفقد في كل Token. يفرق التقرير بوضوح بين الضمانات النظرية وبين Finite Precision والمعايرة التجريبية.

كيف يعمل الكشف؟

يستقبل Detector النص والمفتاح السري. في كل موضع صالح للقياس يعيد بناء Vocabulary Partition وجدول التكلفة والعمود المختار من السياق السابق، ويحدد Block الذي يحتوي Token المرصود، ثم يحول التكلفة إلى Score. تُجمع Scores لسياقات متميزة وتقارن بـNull Distribution معاير.

تحت افتراضات التقرير يتبع المجموع Gamma Distribution في النص غير المعلّم، ما يسمح بوضع Threshold يستهدف False-Positive Rate محددًا. لا يحتاج Detector إلى معرفة النموذج المولد أو Entropy Budget، لكنه يحتاج Tokenizer وإعداد Watermark المتوافقين. كما يجب التعامل مع السياقات المتكررة بحذر لأنها قد تعيد استخدام نفس القيم العشوائية وتكسر افتراض الاستقلال.

هذه إشارة إحصائية وليست Cryptographic Signature فوق ملف ثابت. التوقيع يفشل عند تغير Bytes؛ أما العلامة الإحصائية فقد تبقى جزئيًا بعد بعض التحرير ثم تضعف تدريجيًا. لذلك تصلح للقياس والتوجيه إلى المراجعة، لكنها خطرة إذا استُخدمت وحدها لمعاقبة شخص أو رفض متقدم أو تقييم طالب أو اتهام بالاحتيال.

تعدّل العلامة المائية للنص أخذ عينات Tokens لإضافة إشارة إحصائية؛ بينما تفحص Media Provenance إشارات C2PA وSynthID منفصلة. ولا تثبت أي نتيجة الحقيقة أو الملكية أو التأليف البشري.
تعدّل العلامة المائية للنص أخذ عينات Tokens لإضافة إشارة إحصائية؛ بينما تفحص Media Provenance إشارات C2PA وSynthID منفصلة. ولا تثبت أي نتيجة الحقيقة أو الملكية أو التأليف البشري. اضغط لعرض أكبر

اقرأ الأرقام المنشورة بصورة صحيحة

تقول OpenAI إنه عند Target False-Positive Rate يساوي 1% كشف Detector العلامة في نحو 80% من مقاطع علم النفس بطول 200 Token ونحو 95% من المقاطع بطول 400 Token. وكان الكشف أقل في المجالات المقيدة مثل الرياضيات. وفي تقييم مستقل لمقاطع 400 Token أدى استبدال 10% من الكلمات بمرادفات إلى انخفاض الكشف من نحو 92% إلى 66%، وأدى استبدال 25% إلى 17%.

هذه نتائج أعلنتها الشركة على Datasets وشروط محددة، وليست SLA عالمية. وهي تثبت ثلاث حقائق تشغيلية: النص القصير يحمل Evidence أقل، والنص منخفض Entropy يترك خيارات لغوية أقل، والتحرير يستطيع إزالة الإشارة. الترجمة والتلخيص وإعادة الصياغة والقوالب وخلط كتابة الإنسان مع النص المولد تغير التوزيع الفعلي.

ولا يجوز تحويل هدف 1% إلى عبارة أن النتيجة الموجبة تعني احتمالًا 99% أن النص مولد. False-Positive Rate مشروط بعينات غير معلّمة تحت توزيع المعايرة. أما Positive Predictive Value فيتأثر أيضًا بنسبة انتشار النص المعلّم في المجتمع ومدى تشابه محتوى الإنتاج مع بيانات المعايرة.

Text Watermarking ليست Content Provenance API

تغطي وثائق Content Provenance API الحالية رفع الصور والصوت. قد تعيد الصور نتائج C2PA Content Credentials وSynthID، بينما يعيد الصوت SynthID. أما فحص النص فمذكور كمسار منفصل يحتاج وصولًا معتمدًا.

C2PA عبارة عن Metadata موقعة تصف المصدر وسجل التعديل، لكن التحويل أو المشاركة قد يزيلان Metadata. SynthID علامة مضمنة في Media وقد تتحمل بعض التحويلات. textGrain إشارة إحصائية داخل اختيارات Tokens. يجب ألا يختصر المنتج هذه الأدلة المختلفة في Boolean واحد اسمه `is_ai`.

| الإشارة | المدخل المعتاد | أقوى تفسير آمن | القيد المهم | |---|---|---|---| | textGrain Detector | نص | اكتُشفت علامة نص متوافقة من OpenAI إحصائيًا | الطول والتحرير والمجال تؤثر في الكشف | | C2PA | Metadata لصورة | Manifest موثوق يسجل المصدر وفعل AI | قد تُزال Metadata | | SynthID | صورة أو صوت مدعوم | اكتُشفت علامة مضمّنة معروفة | عدم الكشف لا يثبت الأصل البشري | | Application Ledger | سجلات طلبك وردك | نظامك ولّد Artifact بهذه الإعدادات | يغطي فقط الحركة التي سجلتها وحفظتها |

تؤكد وثائق API أن `not_detected` تعني غياب إشارة مدعومة مكتشفة، لا أن إنسانًا أنشأ الملف. وتوصي باستخدام Provenance كدليل داخل مراجعة أوسع، وفحص Issuer، واستعمال الملف الأصلي عند الإمكان، وإبقاء Human Review في السيناريوهات عالية المخاطر.

معمارية Provenance للإنتاج

ابدأ من التوليد لا من الكشف. أعط كل طلب Generation ID داخليًا، وسجل Tenant وسياسة المستخدم أو الخدمة وModel Snapshot وإعداد Provenance المدعوم وإصدار Prompt Template وOutput Hash ووقت الإنشاء ومتطلب Disclosure وفئة الاحتفاظ. لا تخزن Prompts أو Outputs الخام أطول من الحاجة؛ يجب أن يلتزم السجل بسياسة الخصوصية والوصول في المنتج.

أظهر Disclosure مرئيًا أو Machine-Readable Label عندما تتطلب التجربة ذلك. العلامة غير المرئية طبقة مرونة وليست بديلًا عن UX شفاف. احفظ Hash للمخرج الأصلي قبل إعادة الصياغة اللاحقة حتى يفرق النظام بين رد النموذج وبين نسخة عدلها إنسان.

عند Ingestion، مرر الصور والصوت إلى Content Provenance API الموثقة فقط عندما يتوافق Format والحجم والموافقة والغرض. مرر النص إلى Detector فقط إذا حصلت المؤسسة على وصول معتمد وحالة استخدام موثقة. خزّن Provider Result الخام ونوع Signal وModel أوIssuer إن وجد وإصدار Detector وسياسة Threshold والوقت. استخرج قرار Review في طبقة منفصلة حتى لا تعيد تغييرات السياسة كتابة Evidence.

{
  "artifact_id": "art_01...",
  "kind": "text",
  "generation": {
    "provider": "openai",
    "model_snapshot": "approved-snapshot",
    "watermark_requested": true
  },
  "evidence": {
    "signal": "textgrain",
    "outcome": "detected",
    "detector_policy_version": "prov-2026-10"
  },
  "decision": "human_review_required"
}

هذا Application Schema مقترح وليس Response Shape من OpenAI. يفصل عمدًا ما طلبه نظامك عما رصده Detector وعما قررته سياستك. لا تنشئ `detected` من Generation Flag، ولا تستنتج مستخدمًا أوPrompt أوConversation من نتيجة Watermark.

أطلق الميزة دون تحويلها إلى مراقبة

احصر أولًا أين يغادر النص المولد منتجك: رسائل العملاء والتقارير ومسودات الدعم والمحتوى التعليمي وقوائم المنتجات والملاحظات الداخلية. صنف أي مخرج يحتاج Disclosure مرئيًا أوProvenance متينًا أوكليهما أو لا يحتاجهما. فعّل Watermark على نموذج مدعوم بعد التحقق من عقد API الحالي؛ لا تخترع Parameter من إعلان الإطلاق.

نفّذ Offline Evaluation على عينات غير حساسة وبموافقة أصحابها. قس Detection حسب اللغة والطول والمجال وTemperature وكثافة القالب ومسار التحرير المتوقع. أضف Negatives من كتابة بشرية ومن نماذج غير مدعومة. اعرض Confusion Matrix وConfidence Intervals بدل رقم Accuracy واحد. احتفظ بـHoldout Set محمية، وأعد الاختبار عند تغير Model أوTokenizer أوDetector أوPipeline التحرير.

بعد ذلك استخدم الإشارة في توجيه منخفض المخاطر: إرفاق Disclosure أوإعطاء أولوية للمراجعة أوقياس التغطية مجمعة. لا ترفض طالبًا أو متقدمًا أو مؤلفًا أو عميلًا تلقائيًا لأن Detector واحد أعطى Positive. اشترط Evidence إضافية ومسار Appeal وحد احتفاظ. احم وصول Detector والنتائج بأقل صلاحيات لأن تحقيقات Provenance قد تتضمن مستندات حساسة حتى لو لم تعرّف حساب المولد.

أفضل الاستخدامات

تناسب Text Watermarking المنتجات التي تتحكم بالتوليد وتريد Signal تتحمل النسخ البسيط: أدوات النشر ومساعدات المعرفة المؤسسية ومسودات دعم العملاء والمنصات التي تقيس الشفافية إجمالًا. تكون أقوى مع نص Natural Language طويل بما يكفي ولا يتعرض لتحرير واسع.

أما Content Provenance API المنفصلة فتلائم Pipelines الثقة والسلامة أو التحرير التي تفحص صورًا وصوتًا مدعومين. أرسل الملف الأصلي عندما يمكن، واحفظ كل Result مستقلًا، وأعد المحاولة فقط للأخطاء المؤقتة مثل Rate Limit أوServer Error. الملف التالف أوغير المدعوم Validation Outcome وليس سببًا لمحاولات عمياء.

استخدم Generation Ledger الخاصة بك عندما تملك الطلب. يمكن أن تقدم First-Party Evidence أقوى من الكشف الإحصائي اللاحق لأنها تسجل Transaction الفعلية. اجمع السجل والإفصاح المرئي وإشارة Provenance وسياسة Review؛ لا تغطي طبقة واحدة كل Edit أوExport أوProvider.

متى لا تستخدمها؟

لا تستخدم Watermark Detector ككاشف عام لكل محتوى AI. تقول الوثائق الرسمية إن Media API تفحص إشارات OpenAI المدعومة وليست كل المزودين، كما أن إطلاق النص محدود بالنموذج والوصول. لا تعتبر الغياب إثباتًا للكتابة البشرية. ولا تستخدم الوجود للحكم على الحقيقة أوالقانونية أوالملكية أوهوية صاحب Prompt.

تجنب Enforcement المبني على Watermark في Labels القصيرة أوCode Fragments أوالمعادلات أوStructured JSON أوالمحتوى شديد القوالب. تترك هذه المخرجات حرية محدودة لاختيارات Tokens وقد لا تحمل إشارة قوية. إذا كان المطلوب Non-Repudiation لمستند معتمد فاستخدم Cryptographic Signature وImmutable Audit Log؛ العلامة الإحصائية تحل مشكلة مختلفة.

لا تفعّل Provenance بصمت بطريقة تخالف عقود العملاء أوالمتطلبات الإقليمية أووعود معالجة البيانات. راجع النماذج المدعومة وData Controls وتوافر Cloud Provider للنشر الفعلي. توفر الميزة في إعلان لا يثبت أن كل Account وRegion وModel تكشف نفس الإعداد.

Failure Modes وAnti-Patterns

أول Anti-Pattern هو Boolean واحد اسمه `ai_generated`، لأنه يمحو Provider Scope ونوع Signal وConfidence وIssuer والتاريخ وسجل التحويل. والثاني هو تحويل Detector Threshold إلى حكم أخلاقي. والثالث هو اختبار Long English Prose فقط ثم فرض النتيجة على العربية أوالكود أوالرياضيات أوالمحتوى المترجم.

راقب Detector Drift وحركة النماذج غير المدعومة وانخفاض Scored Tokens وفقد الإشارة بعد التحويل وتكرار الفحص واختلاف Flags بين اللغات وقرارات المراجعين المخالفة للأتمتة. ضع Rate Limit على Endpoints الفحص، واستخدم Hash دقيقًا لتفادي إعادة فحص نفس الملف، ولا تعرض Keys أوتفاصيل Detector للعملاء.

حتى Result تحتاج Provenance. خزّن أي Detector وأي Policy أنتجاها. إذا غيرت المؤسسة Threshold أوحصلت على Detector أفضل، فأعد التقييم من Evidence المحتفظ بها فقط عندما تسمح سياسة الاحتفاظ وتوقعات المستخدم؛ لا تعد كتابة القرار التاريخي بصمت.

قاعدة قرار عملية

اعتمد Text Watermarking عندما يتحكم المنتج في التوليد ويستخدم نماذج مدعومة وينتج Natural Language كافيًا ولديه غرض Disclosure أوReview واضح. اجعلها اختيارية وقابلة للمراقبة أثناء التقييم، واربطها بـFirst-Party Generation Ledger وUX مرئي.

لا تعتمدها كـUniversal Classifier أوطريق مختصر يتجاوز الإجراءات العادلة. تستطيع إشارة مكتشفة دعم العبارة الضيقة: وُجدت علامة OpenAI متوافقة تحت إعداد Detector معين. لكنها لا تخبرك بمن ولّد النص، أوكم عدله إنسان، أوهل هو صحيح، أوهل استخدامه مسموح.

لضوابط إنتاج مرتبطة، راجع أنظمة الذكاء الاصطناعي والاسترجاع وتوجيه نماذج GPT-6.1 ومعمارية زمن الاستجابة في OpenAI Ultrafast. يجب أن تقف Provenance بجوار Model Selection والتقييم والأمان والإفصاح للمستخدم، لا فوقها.

المراجع الرسمية

تدعم هذه المراجع سلوك الأدوات المذكورة. الأمثلة وقرارات التصميم توضيحية، ويجب تكييفها مع متطلبات المشروع وإصداراته.

إعداد: Noor Yasser

من القرار إلى التنفيذ

تعمل على تحدٍ تقني مشابه؟

أساعد الفرق على تحويل القرار المعماري إلى نطاق واضح وتنفيذ يمكن تشغيله ومراجعته بثقة.

احجز لقاءً لمدة ٣٠ دقيقةالخدمة المرتبطةتكاملات الذكاء الاصطناعي وأنظمة RAGمشروع من الأعمالAI Action Studio