الذكاء الاصطناعي · توليد الكلام

Gemini 3.8 TTS في الإنتاج: الأصوات والبث والموافقة

دليل إنتاجي لـGemini 3.8 Flash TTS وFlash‑Lite يشرح اختيار النموذج، والبث الصوتي، والأصوات الدائمة، والموافقة، والتخزين المؤقت والتقييم.

المسار المرتبطالذكاء الاصطناعي وRAG والبحث المتجهي
رسم تحريري تصوري لمساري معالجة تحويل النص إلى كلام يلتقيان في هوية صوتية دائمة مؤمّنة وموجة خرج صوتي؛ وليس واجهة من Google.
تصوّر بصري للفكرة — يتبعه شرح ومخطط تنفيذي داخل المقال.

يقدّم Gemini 3.8 Flash TTS وFlash‑Lite TTS نموذجين إنتاجيين لتحويل النص إلى كلام، وليس نموذج محادثة عامًا أُضيف إليه خيار صوت. أعلنت Google إتاحتهما العامة في 22 سبتمبر 2026 مع واجهة Voices API. يركز Flash على الدقة الصوتية والأداء التعبيري والثبات في المحتوى الطويل، بينما يستهدف Flash‑Lite التوليد الكثيف والحساس لزمن الاستجابة. لذلك يحتاج الاستخدام الحقيقي إلى مسار يوجّه الطلبات، ويثبت النص المعتمد، ويفوّض هوية الصوت، ويتعامل مع صيغة البث، ويخزّن النتائج بطريقة حتمية ويقيس الجودة؛ وليس مجرد تغيير اسم النموذج والاستماع إلى عينة واحدة.

تم التحقق من وثائق Google في 6 أكتوبر 2026. قدرات النماذج وحدودها وسياسات الاحتفاظ بالأصوات حقائق موثقة من المزود. أما سياسات التوجيه وحدود التخزين ومفاتيح Cache وبوابات التقييم وخطة الإطلاق فهي توصيات هندسية.

ما الذي أطلقته Google فعليًا؟

يسجل سجل Gemini API إتاحة `gemini-3.8-flash-tts` و`gemini-3.8-flash-lite-tts` للعامة في 22 سبتمبر 2026، مع المسار `/v1beta/voices` لتصفح الأصوات، وتصميم شخصية صوتية دائمة من وصف نصي، واستنساخ صوت شخص بالغ بعد تسجيل موافقته.

يقبل النموذجان نصًا ويعيدان صوتًا. تذكر بطاقتا النموذج حد إدخال 8,192 Token وحد إخراج خدمي 16,384 Token، ودعم Caching وBatch وFlex وPriority inference، وعدم دعم Function Calling أوLive API أوStructured Outputs أوSearch Grounding أوThinking. يوثق Flash أكثر من 130 لغة، وFlash‑Lite أكثر من 100 لغة. لكن دعم اللغة لا يعني تساوي اللهجة أو النطق أو التعبير، لذا يجب اختبار الـLocale والمحتوى الحقيقيين.

اختر TTS بدل Live Audio عندما يكون النص محددًا

تفرق Google بين TTS وLive API. استخدم Gemini 3.8 TTS عندما يكون النص النهائي معروفًا ويحتاج قراءة مضبوطة: تعليق صوتي، أوإتاحة المحتوى، أوإعلانات محلية، أومقطع Podcast، أوآخر مرحلة صوتية في وكيل. الإدخال نص فقط والإخراج صوت فقط.

استخدم Live Audio عندما يجب على النموذج الاستماع إلى مدخل متعدد الوسائط والاستدلال والتفاعل صوتيًا داخل جلسة لحظية واحدة. لا ترسل بث الميكروفون إلى TTS، ولا تستخدم Live لمجرد قراءة نص جاهز. في وكيل عملي، يقرر نموذج الاستدلال الجواب، وتعتمد طبقة السياسة النص النهائي، ثم يقرأه TTS. يفصل ذلك بين التفكير والرسالة المسموعة ويجعل التدقيق والتنقيح وإعادة المحاولة أوضح.

وجّه Flash وFlash‑Lite بحسب عبء قابل للقياس

يشترك النموذجان في مخطط الطلب نفسه، لذا يمكن أن يكون التوجيه قرارًا داخل التطبيق. استخدم Flash للسرد بجودة استوديو، والنطق الصعب، واللهجات الإقليمية، والحوار التعبيري متعدد المتحدثين، والمحتوى الطويل الذي يضر فيه تغير النبرة أوRoom Tone. واستخدم Flash‑Lite للتوليد الكثيف، وRead-aloud، والإشعارات الروتينية، وصوت كل Turn في الوكلاء عاليي الاستخدام.

لا تربط النموذج الأقوى بكل طلب. صنّف العبء مثل `creative_long_form` أو`transactional_short` أو`accessibility_read_aloud` أو`agent_turn`، ثم قارن الجودة والزمن والكلفة على مجموعة ممثلة. قد لا يكسب إشعار قصير شيئًا من Flash، بينما قد يفقد كتاب صوتي ثباته إذا اختير النموذج على أساس السرعة فقط. احتفظ بمسار بديل يحافظ على النص نفسه وتفويض الصوت.

يفصل مسار TTS الإنتاجي بين تجهيز النص، وتوجيه النموذج، وتفويض الصوت، والتوليد المتدفق، والتحقق من الصيغة، والتخزين المؤقت وقياس الجودة.
يفصل مسار TTS الإنتاجي بين تجهيز النص، وتوجيه النموذج، وتفويض الصوت، والتوليد المتدفق، والتحقق من الصيغة، والتخزين المؤقت وقياس الجودة. اضغط لعرض أكبر

اجعل النص عقدًا غير قابل للتغيير أثناء التوليد

يتعامل Gemini 3.8 مع الإدخال كنص يُقرأ حرفيًا. ضع تعليمات الأداء المستمرة، مثل السرعة والعاطفة والنبرة، داخل `speech_metadata.style`. واستخدم الوسوم بين أقواس زاوية فقط للأحداث اللحظية مثل `<laugh>` و`<sigh>` و`<short pause>`. وتوصي Google بأسماء الوسوم الإنجليزية حتى عندما يكون النص عربيًا.

ثبّت النص قبل التوليد واحفظ Hash له. أخفِ الأسرار، ووسّع الاختصارات الغامضة، ووحّد الأرقام، وحدد كيف تُنطق التواريخ والعملات وأكواد المنتجات حسب اللغة. لا تسمح لمستند مسترجع أن يحقن تعليمات أداء أوVoice ID آخر. يجب أن يقرأ النموذج محتوى معتمدًا لا أن يعيد تفسير سياق غير موثوق.

{
  "transcript_hash": "sha256:...",
  "locale": "ar-XA",
  "model": "gemini-3.8-flash-lite-tts",
  "voice_ref": "voice_catalog:v7",
  "style_version": "support-calm-v2",
  "format": "audio/l16;rate=24000;channels=1"
}

هذا سجل للتطبيق وليس مخطط Gemini. يمنح التوليد والتخزين المؤقت والتحقيق في الأعطال الهوية نفسها.

تعامل مع البث كبروتوكول Bytes

يوثق دليل توليد الكلام حدًا مهمًا للصيغة. يعيد الطلب العادي ملف WAV كاملًا افتراضيًا مع RIFF Header. أما الطلب المتدفق فيعيد دفعات PCM خام بلا Header، بصيغة 16-bit signed little-endian وتردد 24 kHz وقناة واحدة افتراضيًا. جمع ملفات WAV مستقلة دون إزالة رؤوسها ينتج Stream غير صالح.

في المتصفح أوالتطبيق، خزّن قدرًا صغيرًا يمنع انقطاع التشغيل، لكن لا تبدأ قبل التحقق من أول Chunk وصيغته. احفظ الترتيب، وطبّق Backpressure، وأوقف الإرسال عند انقطاع العميل. للاتصالات الهاتفية اطلب G.711 mu-law أوA-law والتردد المطلوب صراحة بدل تحويل غير مضبوط بعد التوليد. خزّن MIME type وSample Rate وBit Depth وعدد القنوات مع كل Artifact.

تحتاج إعادة محاولة البث إلى خطة تسليم جديدة. إذا فشل التوليد بعد سماع المستخدم ثلاث ثوانٍ، فقد تكرر الكلمات عند البدء من Byte صفر. احفظ حدود الجمل أوالأدوار، وسجل المقاطع التي وصلت محليًا، وأعد البدء من حد دلالي آمن. لا تدّع استكمالًا على مستوى Bytes عندما أعطاك API Stream جديدًا.

امنح هوية الصوت دورة حياة

يدعم Gemini 3.8 أربعة مسارات: 30 صوتًا جاهزًا، ومكتبة موسعة عبر `GET /v1beta/voices`، وأصوات مصممة من وصف طبيعي، وأصوات مستنسخة من تسجيل مرجعي وموافقة. يعيد Voice Design معرف `voice_...` قابلًا لإعادة الاستخدام وعينة للاستماع.

عامل الصوت كإعداد منتج له Version. سجّل المالك واللغات المسموحة والاستخدامات المعتمدة والمصدر والمراجع والحالة والصوت البديل. قد يُعتمد صوت تسويقي للسرد المنشور لا للمكالمات المالية. استخدم Alias منطقيًا داخل القوالب، ثم حله إلى معرف المزود الحالي وقت التوليد؛ فتستطيع الإلغاء أوالتدوير دون تعديل كل مستند.

احتفاظ المزود لا يغني عن حوكمتك. توثق Google حدًا مشتركًا قدره 200 صوت مخصص دائم لكل مشروع، ومدة سنة تتجدد بالاستخدام. أما `voicekey_...` المستنسخ بلا تخزين من المزود فيبقى سبعة أيام ويديره العميل. أنشئ Inventory وحذفًا ومراقبة Expiry بدل اكتشاف الصوت المفقود أثناء طلب حي.

اربط استنساخ الصوت بموافقة مسجلة وغرض واضح

تطلب Google تسجيلين للشخص البالغ نفسه: 10–30 ثانية من كلام واضح، وتسجيلًا لعبارة الموافقة الإلزامية بإحدى اللغات المدعومة. تتضمن الوثائق عبارة عربية، وتوصي بصوت WAV أحادي 24 kHz و16-bit. هذا يحقق شرط المزود، لكنه لا يثبت وحده كل الحقوق القانونية لكل استخدام لاحق.

احفظ Artifact الموافقة وHash واللغة ووقت الالتقاط والتحقق من الهوية والمنتجات المسموحة والانتهاء والإلغاء في Registry مقيد. افصل صلاحية قراءة التسجيل الحيوي عن صلاحية التوليد بصوت معتمد. سجّل استخدام Voice ID دون تسجيل الصوت الحساس افتراضيًا. عند الإلغاء، عطّل Alias، واحذف هوية المزود عند الحاجة، وأبطل Cache وفق السياسة، واحتفظ فقط بأدلة التدقيق التي يسمح بها الأساس القانوني.

لا تعتبر مقطعًا عامًا دليل موافقة. ولا تسمح لعميل باستدعاء `voice_...` يخص عميلًا آخر. معرف الصوت قدرة حساسة يجب حلها تحت Tenant Scope موثّق.

صمّم الحوار متعدد المتحدثين ضمن الحدود الموثقة

يدعم الطلب الواحد حتى متحدثين اثنين باستخدام أصوات جاهزة، ويجب أن يحمل كل Turn اسم المتحدث المعرّف. وإذا استُخدمت أصوات مصممة أومستنسخة، تقول الوثائق أن كل دور يُولّد منفصلًا، ثم تُجمع النتائج عمدًا.

احتفظ بـManifest فيه ترتيب الدور وSpeaker Alias وTranscript Hash وVoice Version وStyle وArtifact والمدة المتحققة. اطلب PCM خامًا أوأزل Header لكل WAV قبل الدمج. أضف الصمت أوالتداخل في خطوة تحرير صريحة. يمنع ذلك خطأ شائعًا: معاملة عدة ملفات مستقلة كأنها Container واحد متصل.

قد تحسن Backchannels ووسوم التداخل الأداء، لكنها تصعّب التوقيت وإتاحة النص. احتفظ بنص نظيف وتسميات المتحدثين وCaptions كمصادر مستقلة. لا تستخرج Captions من المزيج النهائي ما دام النص المعتمد موجودًا.

خزّن الصوت الحتمي لا التفويض

يمكن لـAudio Cache على مستوى التطبيق إزالة التوليد المتكرر للمحتوى الثابت. ابنِ المفتاح من Transcript Hash وإصدار النموذج وإصدار الصوت وStyle Version واللغة وصيغة الخرج. أي تعديل للنص أوتدوير للصوت أوقاموس نطق جديد يجب أن يولد مفتاحًا مختلفًا. لا تستخدم النص الخام وحده.

تحقق من صلاحية الصوت قبل تقديم ملف مخزّن. قد يفرض إلغاء صوت مستنسخ إيقاف تشغيل مستقبل حتى لو بقي الملف في التخزين. افصل Object Storage غير القابل للتعديل عن Delivery Policy المتغيرة. استخدم روابط تنزيل قصيرة العمر للصوت الخاص، وضع Lifecycle للمسودات المهجورة.

لا تخزّن صوتًا شخصيًا أوحساسًا إلا إذا برر الغرض ونموذج الوصول وسياسة الحذف ذلك. أحيانًا يكون إعادة التوليد أقل مخاطرة من Shared Cache معقد.

قيّم تجربة الاستماع كاملة

العينة الجميلة ليست Evaluation. ابنِ مجموعة تشمل الأسماء، والأرقام العربية والإنجليزية، والعملات، والاختصارات، والعناوين، وأكواد المنتجات، والفقرات الطويلة، وتغير المشاعر، وعلامات الترقيم، واللهجات والمدخلات السيئة. ضمّن مراجعة بشرية من متحدثين يتقنون الـLocales الفعلية.

قس Text Fidelity وأخطاء النطق وثبات المتحدث والحذف أوالإضافة غير المرغوبة والالتزام بالأسلوب وتفضيل المستمع. تشغيليًا راقب Time to First Audio ومدة التوليد وStream Underruns وإعادة المحاولة والـBytes التي وصلت قبل الفشل وCache Hit Rate والكلفة لكل دقيقة مكتملة ومعدل الإكمال. وللأصوات المستنسخة أضف محاولات الاستخدام غير المصرح بها ووقت انتشار الإلغاء.

قارن Flash وFlash‑Lite على النصوص والإعدادات نفسها. لا ترفع Route إلى الإنتاج إلا إذا بقيت فائدته في Blind Review وظروف شبكة مشابهة للإنتاج. ادعاءات المزود عن الجودة أوالكفاءة فرضيات بداية وليست نتائج مستخدميك.

متى لا تستخدم Generative TTS؟

استخدم تسجيلًا بشريًا عندما يكون النص ثابتًا، والمشاعر حاسمة، والتغيير نادرًا. استخدم TTS تقليديًا حتميًا عندما يكون النطق المتوقع أوالتشغيل دون إنترنت أومجموعة أصوات معتمدة صغيرة أهم من التعبير. واستخدم Live API للمحادثة الصوتية ثنائية الاتجاه فعلًا. لا تستخدم صوتًا مستنسخًا إذا لم تستطع فرض الموافقة والإلغاء وعزل العملاء.

تجنب الكلام التوليدي للتعليمات القانونية أوالطبية أوالمالية أوالطارئة دون نص راجعه إنسان وProvenance واضح وFallback أكثر أمانًا. لا تنشئ صوتًا لانتحال شخصية عامة أوزميل. ولا تحول نصًا خاصًا إلى صوت لمجرد أن الواجهة تسمح؛ طبّق تصنيف البيانات نفسه على الأصل والصوت.

قائمة إطلاق إنتاجية

ابدأ بأصوات جاهزة ومحتوى قصير غير حساس. ثبّت تطبيع النص وصيغ الخرج، ثم اختبر المسارين العادي والمتدفق منفصلين. اجعل Flash‑Lite هو المسار الافتراضي، وقارن Flash فقط حيث يثبت التقييم مكسبًا في الجودة. أضف الأصوات المصممة بعد وجود الملكية والإصدارات، ثم أضف الاستنساخ أخيرًا خلف دليل موافقة وعزل وإلغاء وتدقيق.

نفذ Canary لكل لغة واستخدام. حدد حدود الرجوع لأخطاء النطق والكلمات المفقودة وانحراف الصوت وزمن أول صوت وفشل البث والكلفة غير المتوقعة وانتهاك سياسة الموافقة. احتفظ بصوت جاهز بديل لا يعتمد على هوية مخصصة.

القاعدة المعمارية بسيطة: النص هو الرسالة المعتمدة، والصوت هو هوية مفوضة، والملف الصوتي Artifact له إصدار. يستطيع Gemini 3.8 TTS توليد الأداء، لكن التطبيق يملك الإذن ودورة الحياة والتسليم والحقيقة. اربط هذا المسار مع هندسة وكلاء Gemini 3.8 Live، وتنفيذ وكلاء AI بصورة دائمة، وقابلية مراقبة الأنظمة الخلفية.

المراجع الرسمية

تدعم هذه المراجع سلوك الأدوات المذكورة. الأمثلة وقرارات التصميم توضيحية، ويجب تكييفها مع متطلبات المشروع وإصداراته.

إعداد: Noor Yasser

من القرار إلى التنفيذ

تعمل على تحدٍ تقني مشابه؟

أساعد الفرق على تحويل القرار المعماري إلى نطاق واضح وتنفيذ يمكن تشغيله ومراجعته بثقة.

احجز لقاءً لمدة ٣٠ دقيقةالخدمة المرتبطةتكاملات الذكاء الاصطناعي وأنظمة RAGمشروع من الأعمالAI Action Studio