كل مقالات شعاع ←
🔦 شعاع · كيف بنيناه
الأحد 20 سبتمبر 2026 · 9 min قراءة

صوت عربي مجاني لفيديوهاتك: كيف نولّد تعليق ذُكاء بـGemini بلا اشتراك

كل تعليق صوتي في فيديوهات ذُكاء منذ أغسطس مولَّد بـGemini TTS — بلا اشتراك، وبتكلفة صفر حتى اليوم. الفكرة بسيطة: Google تعطي نماذج تحويل النص إلى كلام مجاناً في الطبقة المجانية، وصوتها العربي أنظف مما توقّعنا. لكن المجاني له جدار، وضربناه مرتين. هذي الطريقة كاملة كما نشغّلها فعلاً: الصوت الذي اخترناه، الحد اليومي الذي أوقفنا، حيلة التوقيت التي بنيناها لأن النموذج لا يعطيك توقيتات، وقاعدة عدّ الحروف قبل التوليد — ثم الحالة الوحيدة التي ما زلنا ندفع فيها.

إفصاح: رابط ElevenLabs في هذا المقال رابط إحالة (affiliate) — لو اشتركت عن طريقه قد نحصل عمولة بلا زيادة عليك. وننبّه مبكراً: هذا المقال يشرح كيف تستغني عن الاشتراك، والأداة المدفوعة مذكورة في موضع واحد محدّد جرّبناه وفشل فيه المجاني. الأسعار والحدود أدناه فُحصت من الصفحات الرسمية يوم 19 سبتمبر 2026، وروابطها أسفل المقال.

⚡ الخلاصة بسرعة

  • الخلاصة: Gemini TTS يولّد تعليقاً عربياً بجودة نشر، مجاناً، عبر واجهة برمجية — لا رفع ملفات ولا لوحة تحكّم.
  • الصوت: Charon للعربية (توصيفه الرسمي Informative)، وRasalgethi للإنجليزية — من أصل 30 صوتاً جاهزاً.
  • الجدار: الحد اليومي. قِسناه من رسالة الرفض نفسها: 10 طلبات/يوم لكل نموذج على حدة، و3 طلبات في الدقيقة.
  • التوقيت: النموذج لا يرجع علامات كلام — نولّد جملة لكل نداء، ونقيس مدة كل ملف بـffprobe، ونبني التوقيتات بإزاحة تراكمية.
  • متى ندفع؟ حالة واحدة: العامية السعودية الطويلة. الفصحى مجانية، واللهجة تسقط على البديل المجاني الثاني.

وش يسوّي بالضبط؟

تعطي النموذج نصاً، فيرجع لك صوتاً. لا أكثر ولا أقل — وهذا بالضبط ما يجعله مناسباً للأتمتة. لا صفحة ترفع فيها ملفاً ولا زر تنتظره: نداء واحد على الواجهة البرمجية يخرج منه ملف PCM بتردد 24kHz و16-bit، نلفّه WAV ثم نحوّله mp3 بـffmpeg.

الوثائق الرسمية تذكر ثلاثة نماذج تدعم الكلام: Gemini 3.1 Flash TTS Preview و2.5 Flash Preview TTS و2.5 Pro Preview TTS. الأول أرقى صوتاً في سماعنا، والثاني أخفّ وأسرع. والعربية مدرجة ضمن أكثر من مئة لغة ولهجة يدعمها النموذج، بالرمز ar بلا تفريع إقليمي.

وفيه تفصيلة تُغفل عادة: الوثائق تسمح بتوجيه الأداء بلغة طبيعية داخل النص نفسه — مثال Google الحرفي هو «Say in a spooky whisper». يعني تكتب للنموذج كيف يقرأ، لا ما يقرأ فقط. هذي الخاصية أنقذتنا وأوقعتنا في مشكلة معاً، وسيأتي تفصيلها.

الصوت الذي اخترناه ولماذا

الوثائق تعرض 30 صوتاً جاهزاً، لكل واحد توصيف من كلمة واحدة: Bright لـZephyr، Warm لـSulafat، وهكذا. بعد سماع عيّنات اختار فالح Charon للعربية — توصيفه الرسمي Informative، وهو الأقرب لنبرة نشرة أخبار هادئة لا معلّق حماسي.

وللإنجليزية اخترنا Rasalgethi عمداً لأن توصيفه Informative أيضاً — فالانتقال بين مقطع عربي ومقطع إنجليزي لا يُسمع فيه تغيّر شخصية. هذي نقطة يهملها كثيرون: اتساق النبرة عبر اللغتين أهم من جمال كل صوت منفرداً.

الجدار: عشرة طلبات في اليوم

هنا يبدأ الجزء الذي لن تجده مكتوباً بوضوح. صفحة حدود الاستخدام في وثائق Gemini لا تعرض أرقام الطبقة المجانية أصلاً، بل تحيلك إلى لوحة AI Studio في حسابك — أي أن الرقم يخصّك أنت ويتغيّر.

لوحتنا كانت تعرض ما يقارب 15 طلباً في اليوم. لكن حين اصطدمنا بالحد فعلاً، كانت رسالة الرفض تحمل quotaValue: 10 مربوطة باسم النموذج. الرقم العملي إذن عشرة طلبات يومياً لكل نموذج على حدة — وهذي «على حدة» أهم كلمة في الجملة.

⚠️ الحيلة التي أنقذت إنتاج يوم كامل: الحدّان مستقلان. حين نفد 3.1 عند الجملة الخامسة من شورت، تحوّلنا إلى 2.5 بحدّه الخاص وأكملنا. لكن أعد توليد كل الجمل بالنموذج الجديد — خلط نموذجين في تعليق واحد يُسمع تفاوته بوضوح.

والقيد الثاني أقسى في العمل اليومي: ثلاثة طلبات في الدقيقة. سكربتنا يباعد النداءات بـ22 ثانية ويعيد المحاولة تلقائياً عند رفض 429. والدرس المكلف: دفعة اختبار سريعة تحرق حدّ الدقيقة وتظهر لك لافتة حمراء تظنها حدّ اليوم — وهي ليست كذلك، تتصفّر خلال دقيقة.

لا توقيتات — وكيف بنيناها

هذي أكبر فجوة تقنية، ولا بد أن تعرفها قبل أن تبني فيديو على هذا المسار: النموذج لا يرجع أي معلومة توقيت. لا علامات جمل ولا كلمات ولا طوابع زمنية — الوثائق لا تذكرها إطلاقاً. ومن يبني فيديو متزامناً مع الصوت يحتاج التوقيتات لا الصوت وحده.

الحل الذي استقرّ عندنا ميكانيكي بحت: جملة واحدة لكل نداء، ثم قياس مدة كل ملف بـffprobe، ثم بناء ملف توقيتات بإزاحة تراكمية مع صمت فاصل ثابت بين الجمل، وأخيراً دمج الملفات بـffmpeg concat. النتيجة ملف توقيتات بنفس صيغة ما يعطيه غيره جاهزاً.

ولهذا التقسيم فائدة ثانية لم نخطط لها: كل جملة ملف مستقل، فلو أردت حذف جملة بعد سماع المسودة تحذف ملفها وتعيد الدمج — بلا إعادة توليد يحرق من حدّك اليومي.

قاعدة عدّ الحروف قبل التوليد

قِسنا سرعة قراءة Charon بالعربية على شورت حقيقي: قرابة 9.5 حرف في الثانية على النموذج 3.1، و10.6 على 2.5. القاعدة العملية التي نستعملها قبل أي توليد: الثواني ≈ عدد الحروف ÷ 10، ونضيف جزءاً من ثانية لكل فاصل بين الجمل.

ولماذا تهمّ هذي القاعدة؟ لأن أول محاولة كتبنا فيها نصاً من 628 حرفاً لشورت هدفه 50 ثانية، فخرج 66 ثانية — تجاوز الحد. أعدنا النص إلى 413 حرفاً فخرج 39 ثانية. الإعادة كلّفتنا من حدّ العشرة، وهذا ثمن لا يُستهان به حين يكون رصيدك اليومي عشرة نداءات.

الشيء الذي لم نحسمه

اسم «ذُكاء» نفسه. النموذج 3.1 ينطقه بلا ضمّة حتى لو كتبناه مشكّلاً بالكامل. وإذا أضفنا توجيه أداء يطلب نطق الذال مضمومة، صحّ النطق لكن دخلت وقفة محسوسة قبل الاسم — كأن النموذج «يستعد» للكلمة الموجّهة. والنموذج 2.5 ينطقها صحيحة لكن جودته أقل.

القرار الذي اتخذناه ليس حلاً بل التفاف: لا ننطق الاسم إطلاقاً. نقول «وزاويتنا» بدل «زاوية ذُكاء»، والوردمارك يظهر مرئياً على الشاشة. المفاضلة بين نطق سليم ووقفة تختفي كلياً، والهوية تصل بالعين. نكتبها هنا لأنها ما زالت مفتوحة، ولو عندك حل أفضل فنحن نسمع.

متى ينزل السلّم — وأين ندفع فعلاً

ترتيبنا الملزم في كل المشاريع: Gemini أولاً، ثم Amazon Polly، ثم ElevenLabs. لا ننتقل خطوة إلا إذا انسدّ الطريق فعلاً.

النزول إلى Polly يحدث في حالتين: حلقة طويلة فيها 40 جملة تقريباً (مستحيلة على عشرة نداءات)، أو يوم احترق فيه الحدّان معاً — وقد حصل. Polly بلا حدّ معدّل مزعج، وطبقته المجانية مليون حرف شهرياً للأصوات العصبية لأول 12 شهراً، وبعدها 16 دولاراً لكل مليون حرف. وفيه ميزة تحلّ مشكلتنا الأولى: يرجع علامات كلام حقيقية. لكن انتبه — أصواته التوليدية الأحدث أغلى (30 دولاراً للمليون) وطبقتها المجانية 100 ألف حرف فقط شهرياً، ومخصّصة لطلبات الكلام لا لعلامات التوقيت.

وفي Polly قاعدة نكتبها بالخط العريض لأننا خالفناها مرة ودفعنا ثمنها: أي اسم منتج إنجليزي داخل جملة عربية يُلفّ بوسم SSML من نوع <lang xml:lang="en-US"> — ووثائق أمازون تؤكد دعمه الكامل في الأصوات العصبية. بلا هذا الوسم ستسمع «فايركرول» و«أنثروبيك» معرّبة نطقاً، وهي أفدح خطأ يفضح أن الصوت آلي.

وأين ندفع؟ في حالة واحدة صريحة: العامية السعودية. جرّبنا Polly عليها مرتين بإعدادين مختلفين — بلا تشكيل وبتشكيل خفيف مع رمز لهجة خليجي — وحكم فالح على الاثنين أنهما مشوّهان. هناك ننتقل إلى ElevenLabs، وهو المكان الوحيد في عُدّتنا الذي يستهلك رصيداً مدفوعاً.

وخطّته المجانية فيها فخّ يستحق التنبيه: 10,000 رصيد شهرياً بلا رخصة استخدام تجاري — الرخصة تبدأ من خطة Starter بستة دولارات شهرياً مع 30,000 رصيد، ثم Creator بـ22 دولاراً (بخصم 50% في الشهر الأول) مع 121,000 رصيد. فلو كنت تنشر محتوى تربح منه، المجاني ليس خياراً قانونياً أصلاً مهما كفاك عدده.

🔦 زاوية ذُكاء

الحكم: المجاني يكفي 90% من العمل العربي — والباقي لهجة لا ميزانية

الحسبة التي خرجنا بها بعد شهر ونصف تشغيل يومي: التعليق الصوتي العربي الفصيح لم يعد بنداً في المصاريف. تكلفتنا الفعلية حتى كتابة هذا المقال صفر، والجودة لم تُشتكَ منها مرة واحدة من متابع.

ولو فُعّل الدفع لاحقاً فالأرقام الرسمية تقول 20 دولاراً لكل مليون رمز صوتي على 3.1 — وبقياسنا الخاص (مقطع 5.5 ثانية استهلك 184 رمزاً صوتياً) يخرج تقدير قرابة 4 سنتات للدقيقة. شورت 40 ثانية بثلاثة سنتات تقريباً. حتى المدفوع رخيص؛ المجاني ليس بديلاً رديئاً بل هو الخيار الصحيح.

وتحفّظنا الصريح: هذا مسار مبرمج لا واجهة. لو كنت لا تشغّل سكربتاً ولا تريد أن تتعلّم، فالسقف الحقيقي هنا ليس الجودة بل استعدادك لتشغيل سطر أوامر.

💡 البديل / متى لا تحتاج هذا كله:

لو تنتج مقطعاً واحداً في الأسبوع بالفصحى، فتوليد يدوي من واجهة AI Studio يكفيك بلا سكربت ولا مفتاح. ولو كان صوتك أنت مقبولاً، فالتسجيل بجوالك أصدق من أي نموذج وأسرع من ضبط كل ما سبق. ولا تبنِ خط إنتاج مبرمجاً إلا حين يصير التوليد يومياً ومتكرراً — قبل ذلك أنت تؤتمت مشكلة لا تملكها.

تحتاج لهجة أو صوتاً مستنسخاً؟

ابدأ بالمجاني أولاً — فهو يغطي الفصحى تماماً. ولو كان محتواك بالعامية أو تحتاج رخصة تجارية، فهنا يبدأ الجزء المدفوع من عُدّتنا.

جرّب ElevenLabs ←
رابط إحالة · الخطة المجانية 10,000 رصيد بلا رخصة تجارية · الرخصة من Starter $6/شهر

المصادر

— ذُكاء، تشرق بكرة إن شاء الله 🌅

كل مقالات شعاع