فهرست مطالب
Gemini TTS ابزار تبدیل متن به گفتار گوگل است: متنی که مینویسید را تقریباً کلمهبهکلمه میخواند و میتوانید صدا، لحن و حتی دو گوینده را کنترل کنید. سریعترین راه برای شروع، Google AI Studio است — playground صوتی / فضای Voice Design — نه نوشتن کد از روز اول. مدلهای فعلی gemini-3.8-flash-tts و gemini-3.8-flash-lite-tts از ۲۳ سپتامبر ۲۰۲۶ در بلاگ گوگل معرفی شدند؛ معرفی کامل محصول را در جمینای ۳.۸ فلش TTS چیست؟ بخوانید. این صفحه فقط قدمبهقدم ساخت صدا است.
نکته مهم برای مبتدیها: صدای زنده در چت جمینای (Live) برای گفتوگوی دوطرفه است؛ TTS برای خواندن دقیق یک اسکریپت (پادکست، دوبله، نریشن) طراحی شده. جزئیات Live جداگانه در جمینای ۳.۸ Live آمده است.
Gemini TTS به زبان ساده چیست؟
طبق مستندات Gemini API، مدلهای TTS ورودی متن میگیرند و خروجی فقط صدا میدهند. متن داخل فیلد گفتار عین متن خوانده میشود؛ اگر بنویسید «با لحن شاد بگو: سلام»، ممکن است همان دستور هم خوانده شود. بنابراین سبک، احساس و نام گوینده را در فیلد style / متادیتای گفتار (speech_metadata) بگذارید، نه داخل جملهای که باید گفته شود. برای انفجارهای کوتاه صوتی (خنده، مکث، آه) از تگهای زاویهای داخل متن استفاده میشود — جزئیات در بخش اسکریپت.
Flash یا Flash-Lite؟ کدام را انتخاب کنید
هر دو مدل در AI Studio و API در دسترساند و همان شکل درخواست را دارند؛ فقط سطح کیفیت و هزینه فرق میکند.
موضوع | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
کد مدل | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
مناسب برای | کار خلاقانه، شخصیت قوی، دیالوگ پیچیده، نریشن بلند | حجم بالا، عامل صوتی، دوبله روزمره، هزینه کمتر |
زبان (تقریبی، طبق کارت مدل) | بیش از ۱۳۰ | بیش از ۱۰۰ |
سطح عمومی (بلاگ) | API + AI Studio + Gemini Notebook | API + AI Studio + Google Vids |
Voice design / replication | بله | بله |
اگر تازه شروع کردهاید، در Studio اول Flash را امتحان کنید تا کیفیت را بشنوید؛ برای تولید انبوه بعداً Lite را جایگزین کنید.
قدم ۱: AI Studio را باز کنید
وارد حساب گوگل شوید و بروید به aistudio.google.com/models/gemini-tts (ورودی رسمی مدلهای TTS).
playground صوتی / فضای Voice Design را باز کنید — بلاگ گوگل آن را workspace طراحی صدا در AI Studio معرفی کرده است.
اگر API Key لازم شد، از همان AI Studio بسازید؛ برای کلیککردن و شنیدن پیشنمایش معمولاً همین محیط کافی است.
گوگل صریحاً پیشنهاد میکند قبل از کدنویسی، مدلها را در AI Studio تست کنید.
قدم ۲: صدا را انتخاب یا بسازید
چهار مسیر رسمی (طبق مستندات speech-generation و voice-design):
صداهای ازپیشساخته (Prebuilt)
حدود ۳۰ صدای استودیویی با نامهایی مثل Kore، Puck، Zephyr، Charon. برای شروع سریع یکی را انتخاب و همان اسکریپت را با چند صدا مقایسه کنید.
کتابخانه گستردهتر (Extended Voice Library)
صدها صدای بیشتر با زبان، لهجه و پرسونای مختلف؛ در Studio قابل مرور است و در API با فهرست Voices هم لیست میشود.
Voice design (شخصیت با متن)
سریعترین مسیر ساخت صدای اختصاصی: در Voice Design studio با یک توضیح کوتاه به زبان طبیعی (سن تقریبی، بافت صدا، لهجه، حالوهوای پایه) پرسونا بسازید، نمونه را بشنوید و شناسه پایدار voice_... را کپی کنید. ویژگیهای ثابت را اینجا تعریف کنید؛ هیجان لحظهای را برای فیلد style نگه دارید.
Voice replication (شبیهسازی از نمونه)
با حدود ۳۰ ثانیه نمونه و تأیید رضایت گوینده میتوان صدا را نزدیک به مرجع ساخت. محدودیت جغرافیایی (بلاگ): این مسیر در AI Studio در ایلینوی، تگزاس، منطقه اقتصادی اروپا (EEA)، بریتانیا، سوئیس و هند در دسترس نیست. بدون رضایت معتبر جلو نروید.
قدم ۳: متن را بنویسید؛ سبک را جدا نگه دارید
در باکس transcript / متن گفتار، فقط چیزی را بنویسید که باید گفته شود — طبیعی، با مکثهای واقعی.
احساس و لحن پایدار نوبت را در فیلد style بگذارید؛ مثالهای مستندات: cheerful and friendly، whispered urgently، calm and relaxed.
برای صدای کوتاه لحظهای از تگهای داخل متن با براکت زاویهای استفاده کنید؛ تگها را حتی اگر اسکریپت فارسی است به انگلیسی نگه دارید.
ویژگیهای دائمی شخصیت را در style تکرار نکنید — آنها را در Voice design قفل کردهاید.
دیالوگ دو نفره (اختیاری)
بلاگ از ویرایشگر dual-speaker screenplay در playground صحبت میکند. در API هم حداکثر ۲ گوینده در یک درخواست با حالت conversational پشتیبانی میشود؛ برای هر نوبت باید گوینده مشخص باشد. اگر صداهای سفارشی voice_... را با هم قاطی میکنید، مستندات میگوید نوبتها را جدا بسازید و بعد بههم وصل کنید.
قدم ۴: تولید، پیشنمایش، دانلود
مدل را انتخاب کنید (Flash یا Flash-Lite).
Generate / تولید را بزنید و پیشنمایش را بشنوید.
اگر لحن غلط است، اول style را کوتاهتر کنید؛ اگر هویت صدا میپرد، به Voice design برگردید نه به پاراگراف طولانی توضیح کارگردان.
فایل را دانلود کنید. در API، درخواست معمولی (غیر استریم) پیشفرض WAV برمیگرداند؛ برای کار بدون کد همان دانلود Studio کافی است.
قدم ۵ (اختیاری): همان صدا در Gemini API
وقتی در Studio شناسه voice_... گرفتید، همان را در درخواست سنتز به تنظیمات صدا بدهید. مدل را مثلاً gemini-3.8-flash-tts بگذارید، متن را verbatim و style را در annotation از نوع speech_metadata بفرستید. مثال کامل و بهروز را فقط از مستندات رسمی بردارید:
قیمت عمومی توکن را در این راهنما نمیآوریم؛ هزینه را در کنسول یا صورتحساب پروژه خودتان ببینید.
محدودیتها و ایمنی
هر کلیپ Gemini Audio با SynthID علامتگذاری میشود (و در بلاگ به C2PA هم اشاره شده).
Voice replication فقط با رضایت منطبق با صدای مرجع؛ محدودیت جغرافیایی بالا را جدی بگیرید.
در یک درخواست چندگوینده: حداکثر ۲ اسپیکر با صداهای ازپیشساخته.
صداهای ذخیرهشده سفارشی: سقف حدود ۲۰۰ صدا در هر پروژه و TTL حدود یک سال (طبق docs).
TTS فقط متن به صدا است؛ تصویر یا ابزار چندوجهی Live را اینجا انتظار نداشته باشید.
اگر با سند و اسلاید داخل جمینای کار میکنید مسیر دیگری است: آموزش Gemini Canvas. برای پادکست از منبع، آموزش NotebookLM را ببینید. زمینه مدلهای فلش جمینای هم در جمینای ۳.۸ فلش و فلش سایبر آمده است.
پرسشهای پرتکرار
Gemini TTS با Gemini Live چه فرقی دارد؟
Live برای گفتوگوی زنده و چندوجهی است؛ TTS برای خواندن دقیق اسکریپت با کنترل سبک و صدا.
از کجا شروع کنم اگر کدنویس نیستم؟
از Google AI Studio مدلهای TTS و Voice Design؛ بعداً در صورت نیاز API.
Flash بهتر است یا Flash-Lite؟
برای کیفیت و کاراکتر قویتر Flash؛ برای حجم و هزینه روزمره Lite. هر دو Voice design دارند.
چرا مدل دستور داخل متن را بلند میخواند؟
چون متن verbatim است. لحن را به فیلد style منتقل کنید.
Voice replication برای من کار نمیکند؛ چرا؟
علاوه بر رضایت، در بعضی مناطق (از جمله EEA، بریتانیا، سوئیس، هند، ایلینوی، تگزاس) در AI Studio محدود شده است.
چند نفره میتوانم در یک فایل بسازم؟
تا دو گوینده در یک درخواست API با حالت conversational؛ در Studio از screenplay دو نفره استفاده کنید.
شناسه voice_... را کجا میگذارم؟
در Studio کپی کنید و در API داخل تنظیمات صدا بهجای نام پیشساخته بفرستید.
آیا خروجی واترمارک دارد؟
بله؛ بلاگ و مستندات به SynthID روی خروجیهای Gemini Audio اشاره میکنند.
منابع
Google Blog — Gemini 3.8 Text-to-Speech (۲۳ سپتامبر ۲۰۲۶): لینک بلاگ
Gemini API — Speech generation: مستندات TTS
Gemini API — Voice design: مستندات Voice design
Google AI Studio — Gemini TTS: ورود به Studio
فناوریکده — معرفی محصول: جمینای ۳.۸ فلش TTS چیست؟



