پرش به محتوای اصلی
ابزارهای هوش مصنوعی

جمینای ۳.۸ فلش TTS چیست؟ ساخت صدا و شخصیت صوتی با گوگل

جمینای ۳.۸ فلش TTS و فلش‌لایت دو مدل تبدیل متن به گفتار گوگل‌اند؛ صدای شخصیت، کارگردانی صحنه، AI Studio و API — از ۲۳ سپتامبر ۲۰۲۶.

۹ دقیقه مطالعه
اشتراک‌گذاری:
کارت رسمی Gemini Audio بلاگ گوگل — اعلام جمینای ۳.۸ فلش TTS، ۲۳ سپتامبر ۲۰۲۶
کارت رسمی Gemini Audio بلاگ گوگل — اعلام جمینای ۳.۸ فلش TTS، ۲۳ سپتامبر ۲۰۲۶
فهرست مطالب

جمینای ۳.۸ فلش TTS و نسخهٔ سبک‌ترش جمینای ۳.۸ فلش‌لایت TTS دو مدل جدید گوگل برای تبدیل متن به گفتار (text-to-speech) هستند؛ یعنی از متن نوشته‌شده، صدای طبیعی و قابل‌هدایت می‌سازند. خبر رسمی ۲۳ سپتامبر ۲۰۲۶ در بلاگ گوگل با نویسندگی Leland Rechis و Alan Cowen اعلام شد: می‌توانید صدای شخصیت از صفر بسازید، روی هر خط مثل کارگردان صحنه جهت بدهید، و در Google AI Studio، Gemini API، Gemini Notebook و Google Vids امتحان کنید.

اگر تا حالا فقط صداهای ثابت ازپیش‌تعریف‌شده را دیده‌اید، تصویر را عوض کنید: اینجا با توضیح به‌زبان آدم‌ها (مثلاً «دی‌جی پرانرژی از ملبورن» یا «ربات نازک و یکنواخت») صدای تازه می‌سازید، از کتابخانهٔ بیش از ۲۰۰۰ صدا انتخاب می‌کنید، یا با حدود ۳۰ ثانیه نمونه (با رضایت صاحب صدا) پروفایل صوتی می‌سازید. برای زمینهٔ مدل‌های متنی هم‌خانواده، مطلب جمینای ۳.۸ فلش و فلش سایبر و برای گفت‌وگوی زنده‌صوتی، جمینای ۳.۸ لایو را ببینید. در ادامه ساده می‌گوییم TTS چیست، فرق دو مدل چیست، صدا و صحنه چطور طراحی می‌شود، کجا امتحان کنید، و محدودیت‌های ایمنی و جغرافیایی چیست.

زمینه کوتاه: TTS یعنی چه؟

TTS مخفف text-to-speech است: سیستم متن را می‌خواند و به صوت تبدیل می‌کند. نسل قدیمی اغلب صدای خشک و یکنواخت داشت. مدل‌های جدیدتر مثل همین خانوادهٔ Gemini Audio سعی می‌کنند لحن، لهجه، مکث و واکنش‌های کوتاه محاوره‌ای (مثل «آها» یا «بله») را هم کنترل‌پذیر کنند. کاربردهای رایج برای سازنده و توسعه‌دهنده: کتاب صوتی، پادکست، دوبله، بازی و شخصیت، ایجنت صوتی پشتیبانی، و خواندن اسلاید یا ویدیو.

خبر ۲۳ سپتامبر ۲۰۲۶ چه بود؟

گوگل دو مدل TTS به خانوادهٔ جمینای اضافه کرد و گفت تولید صدا از «پیش‌تنظیم ثابت» به یک استودیوی خلاق پویا نزدیک شده است. این‌ها بعد از مدل‌هایی مثل 3.5 Live Translate، 3.5 Transcribe، 3.8 Live و 3.8 Live Extended Thinking می‌آیند — یعنی لایهٔ صدا در اکوسیستم جمینای در حال کامل‌شدن است، نه یک ابزار جداافتاده.

  • Gemini 3.8 Flash TTS — برای کارگردانی عمیق و طراحی شخصیت؛ خط‌به‌خط کنترل بازیگری، ریتم، لهجه و واکنش‌های کوتاه.

  • Gemini 3.8 Flash-Lite TTS — برای حجم بالا و هزینهٔ پایین‌تر؛ دوبلهٔ انبوه، تولید محتوای صوتی و ایجنت‌های صوتی با کنترل لحن و ریتم.

جدول مقایسه: Flash TTS در برابر Flash-Lite TTS

هر دو طبق مستندات API اسکیمای مشابه دارند؛ انتخاب بیشتر به کیفیت در برابر مقیاس/هزینه برمی‌گردد. اعداد زبان از کارت مدل رسمی API است؛ بقیه از بلاگ ۲۳ سپتامبر:

موضوع

Flash TTS

Flash-Lite TTS

شناسه API

gemini-3.8-flash-tts

gemini-3.8-flash-lite-tts

نقطهٔ قوت اصلی

وفاداری صوتی، بازیگری، لهجه

توان عملیاتی بالا، تأخیر و هزینه کمتر

کاربرد پیشنهادی

کتاب صوتی، روایت استودیویی، دیالوگ چندنفره پیچیده

تولید انبوه، ایجنت بلادرنگ، خواندن روزمره، دوبلهٔ حجیم

زبان‌ها (کارت API)

حدود ۱۳۰

حدود ۱۰۱

سطح «برای همه» در بلاگ

Gemini Notebook

Google Vids

توسعه‌دهنده

Gemini API و Google AI Studio

همان

سازمانی

Gemini Enterprise — به‌زودی از طریق API

همان («coming soon»)

طراحی صدا: از پرامپت تا کتابخانه و تکثیر

طبق بلاگ، Flash TTS یک استودیوی صوتی کامل‌تر می‌سازد:

  • طراحی مولد صدا: با توضیح نقش، لهجه و ویژگی صدا در بیش از ۱۰۰ زبان/گویش (در بلاگ؛ کارت API برای Flash تا حدود ۱۳۰) صدای سفارشی بسازید — از راوی محلی تا اژدهای ژاپنی در دموهای خود گوگل.

  • کتابخانه: بیش از ۲۰۰۰ صدای آمادهٔ تولید با پوشش منطقه‌ای (مثلاً اسپانیایی مکزیک، فرانسوی کبک، انگلیسی اسکاتلندی).

  • تکثیر صدا (voice replication): از حدود ۳۰ ثانیه نمونهٔ صوتی که حق استفاده‌اش را دارید؛ با تأیید رضایت شفاهی، واترمارک SynthID و اعتبار C2PA.

  • ذخیره و مقیاس: صداهای طراحی‌شده را نگه دارید تا در پروژه‌های بعدی کمتر «از شخصیت خارج» شوند.

  • ریمیکس صدا: گوگل نوشته «به‌زودی» — تنظیم تیموبر، زیروبمی، سرعت و لهجه روی صدای کتابخانه؛ هنوز تاریخ عمومی قطعی اعلام نشده.

کارگردانی اجرا، خط‌به‌خط

بعد از انتخاب صدا، هر دو مدل روی نحوهٔ ادای هر خط کنترل می‌دهند:

  • دستور صحنه بنویسید یا بگذارید جمینای با نشانه‌های طبیعی اسکریپت، لحن را هدایت کند (از اپراتور آرام پشتیبانی تا صحنهٔ نجوا).

  • تولید بلندمدت: برای پادکست و کتاب صوتی؛ حفظ کیفیت و شخصیت در ساعات طولانی با کمترین رانش گوینده (ادعای گوگل).

  • صحنهٔ دونفرهٔ بومی: از یک اسکریپت، گفت‌وگوی چندنوبتی با جدا ماندن دو صدا و نوبت‌گیری طبیعی.

  • ترکیدن‌های صوتی و بک‌چنل: نشانه‌های غیرکلامی و واکنش‌هایی مثل |mhm| یا |yeah| برای ریتم کمدی و واکنش واقعی‌تر.

در مستندات API تأکید شده متن ورودی را بیشتر به‌عنوان متن تحت‌اللفظی ببینید و دستورهای پایدار لحن را در speech_metadata / استایل ساخت‌یافته بگذارید؛ برچسب‌های داخل متن بیشتر برای رویداد لحظه‌ای صدا هستند. جزئیات مهاجرت از مدل‌های قدیمی‌تر TTS در کارت مدل رسمی آمده است.

کجا امتحان کنیم؟ مسیر عملی

۱) Google AI Studio — زمین‌بازی صوتی

از همان روز اعلام، توسعه‌دهندگان می‌توانند در AI Studio صدا بسازند یا (در مناطق مجاز) تکثیر کنند، بعد همان صدا را به ویرایشگر اسکرین‌پلی دونفره ببرند و خط‌به‌خط کارگردانی کنند. برای کار تعاملی و طراحی سریع شخصیت، این اولین ایستگاه منطقی است.

۲) Gemini API — ساخت محصول

شناسه‌ها: gemini-3.8-flash-tts و gemini-3.8-flash-lite-tts. با Voice Design می‌توانید صدای پرامپت‌شده بسازید، voice_... بگیرید و در درخواست تولید صدا استفاده کنید. پلتفرم‌هایی مثل Agora، LiveKit، Pipecat و Vercel در بلاگ به‌عنوان مسیر استقرار تجربهٔ گفتاری نام برده شده‌اند.

۳) Gemini Notebook و Google Vids

طبق بخش rollout بلاگ: Flash TTS برای همه در Gemini Notebook؛ Flash-Lite برای همه در Google Vids. اگر ویدیو یا دفترچه می‌سازید و نمی‌خواهید اول API بنویسید، از همین محصول‌ها شروع کنید. برای جریان کار روی سند و کانواس جمینای، راهنمای جمینای Canvas و برای دفترچهٔ منبع‌محور، آموزش NotebookLM هم مرتبط‌اند (محصول جدا، ولی هم‌خانوادهٔ «صدا از محتوا»).

۴) شرکای محصول

گوگل از یکپارچه‌سازی مدل‌های TTS در شرکت‌هایی مثل Figma، HeyGen، Linguana، Wondercraft، 99.co و Ollang برای دوبلهٔ جهانی، لهجهٔ منطقه‌ای و ایجنت صوتی نام برده است — یعنی اگر از این ابزارها استفاده می‌کنید، ممکن است به‌زودی یا همین حالا موتور صوتی جمینای ۳.۸ زیر پوست محصول باشد.

ایمنی، رضایت و محدودیت جغرافیایی

برای تکثیر صدا، سیستم باید ضبط رضایت شفاهی صاحب صدا را ببیند که با نمونهٔ مرجع جور دربیاید. هر کلیپ تولیدشده با مدل‌های Gemini Audio با SynthID واترمارک می‌شود تا تشخیص محتوای مصنوعی آسان‌تر باشد؛ جزئیات بیشتر در model card رسمی. نکتهٔ مهم برای خوانندهٔ بین‌المللی: تکثیر صدا از طریق AI Studio در ایلینوی، تگزاس، منطقهٔ اقتصادی اروپا (EEA)، بریتانیا، سوئیس و هند در دسترس نیست (پاورقی بلاگ). بقیهٔ قابلیت‌ها را با حساب و منطقهٔ خودتان در Studio/API چک کنید.

امتیازها و بنچمارک — با احتیاط بخوانید

گوگل می‌گوید Flash TTS در بنچمارک Voice Design شرکت Hume AI رتبهٔ کلی ۷۱٫۴ (رتبه ۱) و در مدل‌سازی لهجه ۶۰٫۸ گرفته و هر دو مدل در Overall Quality Index هوم به‌ترتیب ۱ و ۲ هستند؛ در Voice Arena هم در چند زبان پرترافیک جایگاه بالا گزارش شده. این‌ها اعلام شرکت و بنچمارک‌های ذکرشده هستند، نه آزمون مستقل ما. برای تصمیم محصول، یک تست کوتاه روی متن و زبان خودتان در AI Studio هنوز بهترین معیار است.

این ابزار برای چه کسی مناسب است؟

  • سازنده محتوا: پادکست، کتاب صوتی، ویدیوی Vids، شخصیت بازی یا انیمیشن.

  • توسعه‌دهنده: ایجنت صوتی، خواندن رابط، دوبلهٔ محصول چندزبانه با API.

  • تیم محصول/سازمان: وقتی Enterprise API برسد؛ فعلاً مسیر Studio/API عمومی.

  • کمتر مناسب اگر: فقط یک صدای رباتیک کوتاه می‌خواهید و ابزار رایگان ساده کافی است؛ یا در منطقهٔ مسدود تکثیر صدا به کلون صدای واقعی نیاز دارید.

سؤالات پرتکرار

جمینای ۳.۸ فلش TTS چیست؟

مدل تبدیل متن به گفتار پرچمدار گوگل در خانوادهٔ ۳.۸ برای طراحی صدا و کارگردانی خلاق؛ شناسهٔ API آن gemini-3.8-flash-tts است.

فرق Flash TTS با Flash-Lite TTS چیست؟

Flash برای حداکثر کیفیت و بازیگری و لهجه؛ Flash-Lite برای حجم بالا، تأخیر کمتر و هزینهٔ به‌صرفه‌تر. هر دو در API و AI Studio هستند؛ سطح مصرف‌کننده در بلاگ برای Flash به Notebook و برای Lite به Vids اشاره شده است.

از کجا شروع کنم اگر کدنویس نیستم؟

Google AI Studio برای طراحی صدا، Gemini Notebook (Flash) یا Google Vids (Flash-Lite) طبق rollout رسمی.

آیا می‌توانم صدای خودم را کلون کنم؟

با نمونهٔ حدود ۳۰ ثانیه‌ای و رضایت تأییدشده، در مناطق مجاز AI Studio بله؛ در EEA، بریتانیا، سوئیس، هند، ایلینوی و تگزاس این مسیر از AI Studio باز نیست.

چند زبان پشتیبانی می‌شود؟

بلاگ از بیش از ۱۰۰ زبان/گویش می‌گوید؛ کارت API برای Flash حدود ۱۳۰ و برای Lite حدود ۱۰۱ فهرست کرده است.

با جمینای لایو چه فرقی دارد؟

لایو بیشتر گفت‌وگوی دوطرفهٔ زنده است؛ TTS اینجا تولید/کارگردانی گفتار از متن و اسکریپت است. برای لایو مطلب جداگانه داریم.

قیمت دقیقش چقدر است؟

در بلاگ اعلام قیمت جدولی عمومی برای این لانچ برجسته نشده؛ مصرف API تابع سهمیه و قیمت‌گذاری جاری Gemini API است — قبل از تولید انبوه، consoles و مستندات قیمت را چک کنید.

آیا صدا واترمارک دارد؟

طبق گوگل، هر کلیپ Gemini Audio با SynthID واترمارک می‌شود؛ برای تکثیر هم C2PA و تأیید رضایت ذکر شده است.

جمع‌بندی

جمینای ۳.۸ فلش TTS و فلش‌لایت TTS لایهٔ جدی «استودیوی صدا» را به اکوسیستم جمینای اضافه کرده‌اند: طراحی شخصیت با پرامپت، کتابخانهٔ بزرگ، کارگردانی خط‌به‌خط، و مسیرهای واقعی در AI Studio، API، Notebook و Vids. اگر سازنده یا توسعه‌دهنده هستید، از یک صحنهٔ کوتاه دونفره در AI Studio شروع کنید؛ بعد تصمیم بگیرید Flash می‌خواهید یا Lite. ادعاهای بنچمارک را با تست روی زبان و لحن خودتان سبک‌سنگین کنید و محدودیت جغرافیایی تکثیر صدا را جدی بگیرید.

منابع

  • Google Blog — «Gemini 3.8 text-to-speech says hello»، ۲۳ سپتامبر ۲۰۲۶: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/

  • Gemini API — مدل Gemini 3.8 Flash TTS: https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash-tts

  • Gemini API — Voice design: https://ai.google.dev/gemini-api/docs/voice-design

  • Simon Willison — Gemini 3.8 TTS Playground، ۲۳ سپتامبر ۲۰۲۶: https://simonwillison.net/2026/Sep/23/gemini-tts-playground/

برچسب‌ها:هوش مصنوعیجمینایگوگلهوش مصنوعی مولد
اشتراک‌گذاری:

مطالب مرتبط

عضویت در خبرنامه

آخرین اخبار هوش مصنوعی و فناوری را در ایمیل خود دریافت کنید.

پس از عضویت یک ایمیل تأیید برایتان ارسال می‌شود. هر زمان می‌توانید اشتراک خود را لغو کنید و ایمیل شما با شخص ثالثی به اشتراک گذاشته نمی‌شود.