فهرست مطالب
جمینای ۳.۸ فلش TTS و نسخهٔ سبکترش جمینای ۳.۸ فلشلایت TTS دو مدل جدید گوگل برای تبدیل متن به گفتار (text-to-speech) هستند؛ یعنی از متن نوشتهشده، صدای طبیعی و قابلهدایت میسازند. خبر رسمی ۲۳ سپتامبر ۲۰۲۶ در بلاگ گوگل با نویسندگی Leland Rechis و Alan Cowen اعلام شد: میتوانید صدای شخصیت از صفر بسازید، روی هر خط مثل کارگردان صحنه جهت بدهید، و در Google AI Studio، Gemini API، Gemini Notebook و Google Vids امتحان کنید.
اگر تا حالا فقط صداهای ثابت ازپیشتعریفشده را دیدهاید، تصویر را عوض کنید: اینجا با توضیح بهزبان آدمها (مثلاً «دیجی پرانرژی از ملبورن» یا «ربات نازک و یکنواخت») صدای تازه میسازید، از کتابخانهٔ بیش از ۲۰۰۰ صدا انتخاب میکنید، یا با حدود ۳۰ ثانیه نمونه (با رضایت صاحب صدا) پروفایل صوتی میسازید. برای زمینهٔ مدلهای متنی همخانواده، مطلب جمینای ۳.۸ فلش و فلش سایبر و برای گفتوگوی زندهصوتی، جمینای ۳.۸ لایو را ببینید. در ادامه ساده میگوییم TTS چیست، فرق دو مدل چیست، صدا و صحنه چطور طراحی میشود، کجا امتحان کنید، و محدودیتهای ایمنی و جغرافیایی چیست.
زمینه کوتاه: TTS یعنی چه؟
TTS مخفف text-to-speech است: سیستم متن را میخواند و به صوت تبدیل میکند. نسل قدیمی اغلب صدای خشک و یکنواخت داشت. مدلهای جدیدتر مثل همین خانوادهٔ Gemini Audio سعی میکنند لحن، لهجه، مکث و واکنشهای کوتاه محاورهای (مثل «آها» یا «بله») را هم کنترلپذیر کنند. کاربردهای رایج برای سازنده و توسعهدهنده: کتاب صوتی، پادکست، دوبله، بازی و شخصیت، ایجنت صوتی پشتیبانی، و خواندن اسلاید یا ویدیو.
خبر ۲۳ سپتامبر ۲۰۲۶ چه بود؟
گوگل دو مدل TTS به خانوادهٔ جمینای اضافه کرد و گفت تولید صدا از «پیشتنظیم ثابت» به یک استودیوی خلاق پویا نزدیک شده است. اینها بعد از مدلهایی مثل 3.5 Live Translate، 3.5 Transcribe، 3.8 Live و 3.8 Live Extended Thinking میآیند — یعنی لایهٔ صدا در اکوسیستم جمینای در حال کاملشدن است، نه یک ابزار جداافتاده.
Gemini 3.8 Flash TTS — برای کارگردانی عمیق و طراحی شخصیت؛ خطبهخط کنترل بازیگری، ریتم، لهجه و واکنشهای کوتاه.
Gemini 3.8 Flash-Lite TTS — برای حجم بالا و هزینهٔ پایینتر؛ دوبلهٔ انبوه، تولید محتوای صوتی و ایجنتهای صوتی با کنترل لحن و ریتم.
جدول مقایسه: Flash TTS در برابر Flash-Lite TTS
هر دو طبق مستندات API اسکیمای مشابه دارند؛ انتخاب بیشتر به کیفیت در برابر مقیاس/هزینه برمیگردد. اعداد زبان از کارت مدل رسمی API است؛ بقیه از بلاگ ۲۳ سپتامبر:
موضوع | Flash TTS | Flash-Lite TTS |
|---|---|---|
شناسه API | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
نقطهٔ قوت اصلی | وفاداری صوتی، بازیگری، لهجه | توان عملیاتی بالا، تأخیر و هزینه کمتر |
کاربرد پیشنهادی | کتاب صوتی، روایت استودیویی، دیالوگ چندنفره پیچیده | تولید انبوه، ایجنت بلادرنگ، خواندن روزمره، دوبلهٔ حجیم |
زبانها (کارت API) | حدود ۱۳۰ | حدود ۱۰۱ |
سطح «برای همه» در بلاگ | Gemini Notebook | Google Vids |
توسعهدهنده | Gemini API و Google AI Studio | همان |
سازمانی | Gemini Enterprise — بهزودی از طریق API | همان («coming soon») |
طراحی صدا: از پرامپت تا کتابخانه و تکثیر
طبق بلاگ، Flash TTS یک استودیوی صوتی کاملتر میسازد:
طراحی مولد صدا: با توضیح نقش، لهجه و ویژگی صدا در بیش از ۱۰۰ زبان/گویش (در بلاگ؛ کارت API برای Flash تا حدود ۱۳۰) صدای سفارشی بسازید — از راوی محلی تا اژدهای ژاپنی در دموهای خود گوگل.
کتابخانه: بیش از ۲۰۰۰ صدای آمادهٔ تولید با پوشش منطقهای (مثلاً اسپانیایی مکزیک، فرانسوی کبک، انگلیسی اسکاتلندی).
تکثیر صدا (voice replication): از حدود ۳۰ ثانیه نمونهٔ صوتی که حق استفادهاش را دارید؛ با تأیید رضایت شفاهی، واترمارک SynthID و اعتبار C2PA.
ذخیره و مقیاس: صداهای طراحیشده را نگه دارید تا در پروژههای بعدی کمتر «از شخصیت خارج» شوند.
ریمیکس صدا: گوگل نوشته «بهزودی» — تنظیم تیموبر، زیروبمی، سرعت و لهجه روی صدای کتابخانه؛ هنوز تاریخ عمومی قطعی اعلام نشده.
کارگردانی اجرا، خطبهخط
بعد از انتخاب صدا، هر دو مدل روی نحوهٔ ادای هر خط کنترل میدهند:
دستور صحنه بنویسید یا بگذارید جمینای با نشانههای طبیعی اسکریپت، لحن را هدایت کند (از اپراتور آرام پشتیبانی تا صحنهٔ نجوا).
تولید بلندمدت: برای پادکست و کتاب صوتی؛ حفظ کیفیت و شخصیت در ساعات طولانی با کمترین رانش گوینده (ادعای گوگل).
صحنهٔ دونفرهٔ بومی: از یک اسکریپت، گفتوگوی چندنوبتی با جدا ماندن دو صدا و نوبتگیری طبیعی.
ترکیدنهای صوتی و بکچنل: نشانههای غیرکلامی و واکنشهایی مثل |mhm| یا |yeah| برای ریتم کمدی و واکنش واقعیتر.
در مستندات API تأکید شده متن ورودی را بیشتر بهعنوان متن تحتاللفظی ببینید و دستورهای پایدار لحن را در speech_metadata / استایل ساختیافته بگذارید؛ برچسبهای داخل متن بیشتر برای رویداد لحظهای صدا هستند. جزئیات مهاجرت از مدلهای قدیمیتر TTS در کارت مدل رسمی آمده است.
کجا امتحان کنیم؟ مسیر عملی
۱) Google AI Studio — زمینبازی صوتی
از همان روز اعلام، توسعهدهندگان میتوانند در AI Studio صدا بسازند یا (در مناطق مجاز) تکثیر کنند، بعد همان صدا را به ویرایشگر اسکرینپلی دونفره ببرند و خطبهخط کارگردانی کنند. برای کار تعاملی و طراحی سریع شخصیت، این اولین ایستگاه منطقی است.
۲) Gemini API — ساخت محصول
شناسهها: gemini-3.8-flash-tts و gemini-3.8-flash-lite-tts. با Voice Design میتوانید صدای پرامپتشده بسازید، voice_... بگیرید و در درخواست تولید صدا استفاده کنید. پلتفرمهایی مثل Agora، LiveKit، Pipecat و Vercel در بلاگ بهعنوان مسیر استقرار تجربهٔ گفتاری نام برده شدهاند.
۳) Gemini Notebook و Google Vids
طبق بخش rollout بلاگ: Flash TTS برای همه در Gemini Notebook؛ Flash-Lite برای همه در Google Vids. اگر ویدیو یا دفترچه میسازید و نمیخواهید اول API بنویسید، از همین محصولها شروع کنید. برای جریان کار روی سند و کانواس جمینای، راهنمای جمینای Canvas و برای دفترچهٔ منبعمحور، آموزش NotebookLM هم مرتبطاند (محصول جدا، ولی همخانوادهٔ «صدا از محتوا»).
۴) شرکای محصول
گوگل از یکپارچهسازی مدلهای TTS در شرکتهایی مثل Figma، HeyGen، Linguana، Wondercraft، 99.co و Ollang برای دوبلهٔ جهانی، لهجهٔ منطقهای و ایجنت صوتی نام برده است — یعنی اگر از این ابزارها استفاده میکنید، ممکن است بهزودی یا همین حالا موتور صوتی جمینای ۳.۸ زیر پوست محصول باشد.
ایمنی، رضایت و محدودیت جغرافیایی
برای تکثیر صدا، سیستم باید ضبط رضایت شفاهی صاحب صدا را ببیند که با نمونهٔ مرجع جور دربیاید. هر کلیپ تولیدشده با مدلهای Gemini Audio با SynthID واترمارک میشود تا تشخیص محتوای مصنوعی آسانتر باشد؛ جزئیات بیشتر در model card رسمی. نکتهٔ مهم برای خوانندهٔ بینالمللی: تکثیر صدا از طریق AI Studio در ایلینوی، تگزاس، منطقهٔ اقتصادی اروپا (EEA)، بریتانیا، سوئیس و هند در دسترس نیست (پاورقی بلاگ). بقیهٔ قابلیتها را با حساب و منطقهٔ خودتان در Studio/API چک کنید.
امتیازها و بنچمارک — با احتیاط بخوانید
گوگل میگوید Flash TTS در بنچمارک Voice Design شرکت Hume AI رتبهٔ کلی ۷۱٫۴ (رتبه ۱) و در مدلسازی لهجه ۶۰٫۸ گرفته و هر دو مدل در Overall Quality Index هوم بهترتیب ۱ و ۲ هستند؛ در Voice Arena هم در چند زبان پرترافیک جایگاه بالا گزارش شده. اینها اعلام شرکت و بنچمارکهای ذکرشده هستند، نه آزمون مستقل ما. برای تصمیم محصول، یک تست کوتاه روی متن و زبان خودتان در AI Studio هنوز بهترین معیار است.
این ابزار برای چه کسی مناسب است؟
سازنده محتوا: پادکست، کتاب صوتی، ویدیوی Vids، شخصیت بازی یا انیمیشن.
توسعهدهنده: ایجنت صوتی، خواندن رابط، دوبلهٔ محصول چندزبانه با API.
تیم محصول/سازمان: وقتی Enterprise API برسد؛ فعلاً مسیر Studio/API عمومی.
کمتر مناسب اگر: فقط یک صدای رباتیک کوتاه میخواهید و ابزار رایگان ساده کافی است؛ یا در منطقهٔ مسدود تکثیر صدا به کلون صدای واقعی نیاز دارید.
سؤالات پرتکرار
جمینای ۳.۸ فلش TTS چیست؟
مدل تبدیل متن به گفتار پرچمدار گوگل در خانوادهٔ ۳.۸ برای طراحی صدا و کارگردانی خلاق؛ شناسهٔ API آن gemini-3.8-flash-tts است.
فرق Flash TTS با Flash-Lite TTS چیست؟
Flash برای حداکثر کیفیت و بازیگری و لهجه؛ Flash-Lite برای حجم بالا، تأخیر کمتر و هزینهٔ بهصرفهتر. هر دو در API و AI Studio هستند؛ سطح مصرفکننده در بلاگ برای Flash به Notebook و برای Lite به Vids اشاره شده است.
از کجا شروع کنم اگر کدنویس نیستم؟
Google AI Studio برای طراحی صدا، Gemini Notebook (Flash) یا Google Vids (Flash-Lite) طبق rollout رسمی.
آیا میتوانم صدای خودم را کلون کنم؟
با نمونهٔ حدود ۳۰ ثانیهای و رضایت تأییدشده، در مناطق مجاز AI Studio بله؛ در EEA، بریتانیا، سوئیس، هند، ایلینوی و تگزاس این مسیر از AI Studio باز نیست.
چند زبان پشتیبانی میشود؟
بلاگ از بیش از ۱۰۰ زبان/گویش میگوید؛ کارت API برای Flash حدود ۱۳۰ و برای Lite حدود ۱۰۱ فهرست کرده است.
با جمینای لایو چه فرقی دارد؟
لایو بیشتر گفتوگوی دوطرفهٔ زنده است؛ TTS اینجا تولید/کارگردانی گفتار از متن و اسکریپت است. برای لایو مطلب جداگانه داریم.
قیمت دقیقش چقدر است؟
در بلاگ اعلام قیمت جدولی عمومی برای این لانچ برجسته نشده؛ مصرف API تابع سهمیه و قیمتگذاری جاری Gemini API است — قبل از تولید انبوه، consoles و مستندات قیمت را چک کنید.
آیا صدا واترمارک دارد؟
طبق گوگل، هر کلیپ Gemini Audio با SynthID واترمارک میشود؛ برای تکثیر هم C2PA و تأیید رضایت ذکر شده است.
جمعبندی
جمینای ۳.۸ فلش TTS و فلشلایت TTS لایهٔ جدی «استودیوی صدا» را به اکوسیستم جمینای اضافه کردهاند: طراحی شخصیت با پرامپت، کتابخانهٔ بزرگ، کارگردانی خطبهخط، و مسیرهای واقعی در AI Studio، API، Notebook و Vids. اگر سازنده یا توسعهدهنده هستید، از یک صحنهٔ کوتاه دونفره در AI Studio شروع کنید؛ بعد تصمیم بگیرید Flash میخواهید یا Lite. ادعاهای بنچمارک را با تست روی زبان و لحن خودتان سبکسنگین کنید و محدودیت جغرافیایی تکثیر صدا را جدی بگیرید.
منابع
Google Blog — «Gemini 3.8 text-to-speech says hello»، ۲۳ سپتامبر ۲۰۲۶: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
Gemini API — مدل Gemini 3.8 Flash TTS: https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts
Gemini API — Voice design: https://ai.google.dev/gemini-api/docs/voice-design
Simon Willison — Gemini 3.8 TTS Playground، ۲۳ سپتامبر ۲۰۲۶: https://simonwillison.net/2026/Sep/23/gemini-tts-playground/



