پرش به محتوای اصلی
آموزش و راهنما

آموزش Gemini TTS؛ ساخت صدا در AI Studio قدم‌به‌قدم

آموزش قدم‌به‌قدم Gemini TTS در Google AI Studio: انتخاب صدا، Voice Design، اسکریپت با style جدا، دیالوگ دو نفره، دانلود و نکته کوتاه API.

۷ دقیقه مطالعه
اشتراک‌گذاری:
تصویر رسمی بلاگ گوگل برای معرفی جمینای TTS و ساخت صدا
تصویر رسمی بلاگ گوگل برای معرفی جمینای TTS و ساخت صدا
فهرست مطالب

Gemini TTS ابزار تبدیل متن به گفتار گوگل است: متنی که می‌نویسید را تقریباً کلمه‌به‌کلمه می‌خواند و می‌توانید صدا، لحن و حتی دو گوینده را کنترل کنید. سریع‌ترین راه برای شروع، Google AI Studio است — playground صوتی / فضای Voice Design — نه نوشتن کد از روز اول. مدل‌های فعلی gemini-3.8-flash-tts و gemini-3.8-flash-lite-tts از ۲۳ سپتامبر ۲۰۲۶ در بلاگ گوگل معرفی شدند؛ معرفی کامل محصول را در جمینای ۳.۸ فلش TTS چیست؟ بخوانید. این صفحه فقط قدم‌به‌قدم ساخت صدا است.

نکته مهم برای مبتدی‌ها: صدای زنده در چت جمینای (Live) برای گفت‌وگوی دوطرفه است؛ TTS برای خواندن دقیق یک اسکریپت (پادکست، دوبله، نریشن) طراحی شده. جزئیات Live جداگانه در جمینای ۳.۸ Live آمده است.

Gemini TTS به زبان ساده چیست؟

طبق مستندات Gemini API، مدل‌های TTS ورودی متن می‌گیرند و خروجی فقط صدا می‌دهند. متن داخل فیلد گفتار عین متن خوانده می‌شود؛ اگر بنویسید «با لحن شاد بگو: سلام»، ممکن است همان دستور هم خوانده شود. بنابراین سبک، احساس و نام گوینده را در فیلد style / متادیتای گفتار (speech_metadata) بگذارید، نه داخل جمله‌ای که باید گفته شود. برای انفجارهای کوتاه صوتی (خنده، مکث، آه) از تگ‌های زاویه‌ای داخل متن استفاده می‌شود — جزئیات در بخش اسکریپت.

Flash یا Flash-Lite؟ کدام را انتخاب کنید

هر دو مدل در AI Studio و API در دسترس‌اند و همان شکل درخواست را دارند؛ فقط سطح کیفیت و هزینه فرق می‌کند.

موضوع

Gemini 3.8 Flash TTS

Gemini 3.8 Flash-Lite TTS

کد مدل

gemini-3.8-flash-tts

gemini-3.8-flash-lite-tts

مناسب برای

کار خلاقانه، شخصیت قوی، دیالوگ پیچیده، نریشن بلند

حجم بالا، عامل صوتی، دوبله روزمره، هزینه کمتر

زبان (تقریبی، طبق کارت مدل)

بیش از ۱۳۰

بیش از ۱۰۰

سطح عمومی (بلاگ)

API + AI Studio + Gemini Notebook

API + AI Studio + Google Vids

Voice design / replication

بله

بله

اگر تازه شروع کرده‌اید، در Studio اول Flash را امتحان کنید تا کیفیت را بشنوید؛ برای تولید انبوه بعداً Lite را جایگزین کنید.

قدم ۱: AI Studio را باز کنید

  1. وارد حساب گوگل شوید و بروید به aistudio.google.com/models/gemini-tts (ورودی رسمی مدل‌های TTS).

  2. playground صوتی / فضای Voice Design را باز کنید — بلاگ گوگل آن را workspace طراحی صدا در AI Studio معرفی کرده است.

  3. اگر API Key لازم شد، از همان AI Studio بسازید؛ برای کلیک‌کردن و شنیدن پیش‌نمایش معمولاً همین محیط کافی است.

گوگل صریحاً پیشنهاد می‌کند قبل از کدنویسی، مدل‌ها را در AI Studio تست کنید.

قدم ۲: صدا را انتخاب یا بسازید

چهار مسیر رسمی (طبق مستندات speech-generation و voice-design):

صداهای ازپیش‌ساخته (Prebuilt)

حدود ۳۰ صدای استودیویی با نام‌هایی مثل Kore، Puck، Zephyr، Charon. برای شروع سریع یکی را انتخاب و همان اسکریپت را با چند صدا مقایسه کنید.

کتابخانه گسترده‌تر (Extended Voice Library)

صدها صدای بیشتر با زبان، لهجه و پرسونای مختلف؛ در Studio قابل مرور است و در API با فهرست Voices هم لیست می‌شود.

Voice design (شخصیت با متن)

سریع‌ترین مسیر ساخت صدای اختصاصی: در Voice Design studio با یک توضیح کوتاه به زبان طبیعی (سن تقریبی، بافت صدا، لهجه، حال‌وهوای پایه) پرسونا بسازید، نمونه را بشنوید و شناسه پایدار voice_... را کپی کنید. ویژگی‌های ثابت را اینجا تعریف کنید؛ هیجان لحظه‌ای را برای فیلد style نگه دارید.

Voice replication (شبیه‌سازی از نمونه)

با حدود ۳۰ ثانیه نمونه و تأیید رضایت گوینده می‌توان صدا را نزدیک به مرجع ساخت. محدودیت جغرافیایی (بلاگ): این مسیر در AI Studio در ایلینوی، تگزاس، منطقه اقتصادی اروپا (EEA)، بریتانیا، سوئیس و هند در دسترس نیست. بدون رضایت معتبر جلو نروید.

قدم ۳: متن را بنویسید؛ سبک را جدا نگه دارید

  1. در باکس transcript / متن گفتار، فقط چیزی را بنویسید که باید گفته شود — طبیعی، با مکث‌های واقعی.

  2. احساس و لحن پایدار نوبت را در فیلد style بگذارید؛ مثال‌های مستندات: cheerful and friendly، whispered urgently، calm and relaxed.

  3. برای صدای کوتاه لحظه‌ای از تگ‌های داخل متن با براکت زاویه‌ای استفاده کنید؛ تگ‌ها را حتی اگر اسکریپت فارسی است به انگلیسی نگه دارید.

  4. ویژگی‌های دائمی شخصیت را در style تکرار نکنید — آن‌ها را در Voice design قفل کرده‌اید.

دیالوگ دو نفره (اختیاری)

بلاگ از ویرایشگر dual-speaker screenplay در playground صحبت می‌کند. در API هم حداکثر ۲ گوینده در یک درخواست با حالت conversational پشتیبانی می‌شود؛ برای هر نوبت باید گوینده مشخص باشد. اگر صداهای سفارشی voice_... را با هم قاطی می‌کنید، مستندات می‌گوید نوبت‌ها را جدا بسازید و بعد به‌هم وصل کنید.

قدم ۴: تولید، پیش‌نمایش، دانلود

  1. مدل را انتخاب کنید (Flash یا Flash-Lite).

  2. Generate / تولید را بزنید و پیش‌نمایش را بشنوید.

  3. اگر لحن غلط است، اول style را کوتاه‌تر کنید؛ اگر هویت صدا می‌پرد، به Voice design برگردید نه به پاراگراف طولانی توضیح کارگردان.

  4. فایل را دانلود کنید. در API، درخواست معمولی (غیر استریم) پیش‌فرض WAV برمی‌گرداند؛ برای کار بدون کد همان دانلود Studio کافی است.

قدم ۵ (اختیاری): همان صدا در Gemini API

وقتی در Studio شناسه voice_... گرفتید، همان را در درخواست سنتز به تنظیمات صدا بدهید. مدل را مثلاً gemini-3.8-flash-tts بگذارید، متن را verbatim و style را در annotation از نوع speech_metadata بفرستید. مثال کامل و به‌روز را فقط از مستندات رسمی بردارید:

قیمت عمومی توکن را در این راهنما نمی‌آوریم؛ هزینه را در کنسول یا صورتحساب پروژه خودتان ببینید.

محدودیت‌ها و ایمنی

  • هر کلیپ Gemini Audio با SynthID علامت‌گذاری می‌شود (و در بلاگ به C2PA هم اشاره شده).

  • Voice replication فقط با رضایت منطبق با صدای مرجع؛ محدودیت جغرافیایی بالا را جدی بگیرید.

  • در یک درخواست چندگوینده: حداکثر ۲ اسپیکر با صداهای ازپیش‌ساخته.

  • صداهای ذخیره‌شده سفارشی: سقف حدود ۲۰۰ صدا در هر پروژه و TTL حدود یک سال (طبق docs).

  • TTS فقط متن به صدا است؛ تصویر یا ابزار چندوجهی Live را اینجا انتظار نداشته باشید.

اگر با سند و اسلاید داخل جمینای کار می‌کنید مسیر دیگری است: آموزش Gemini Canvas. برای پادکست از منبع، آموزش NotebookLM را ببینید. زمینه مدل‌های فلش جمینای هم در جمینای ۳.۸ فلش و فلش سایبر آمده است.

پرسش‌های پرتکرار

Gemini TTS با Gemini Live چه فرقی دارد؟

Live برای گفت‌وگوی زنده و چندوجهی است؛ TTS برای خواندن دقیق اسکریپت با کنترل سبک و صدا.

از کجا شروع کنم اگر کدنویس نیستم؟

از Google AI Studio مدل‌های TTS و Voice Design؛ بعداً در صورت نیاز API.

Flash بهتر است یا Flash-Lite؟

برای کیفیت و کاراکتر قوی‌تر Flash؛ برای حجم و هزینه روزمره Lite. هر دو Voice design دارند.

چرا مدل دستور داخل متن را بلند می‌خواند؟

چون متن verbatim است. لحن را به فیلد style منتقل کنید.

Voice replication برای من کار نمی‌کند؛ چرا؟

علاوه بر رضایت، در بعضی مناطق (از جمله EEA، بریتانیا، سوئیس، هند، ایلینوی، تگزاس) در AI Studio محدود شده است.

چند نفره می‌توانم در یک فایل بسازم؟

تا دو گوینده در یک درخواست API با حالت conversational؛ در Studio از screenplay دو نفره استفاده کنید.

شناسه voice_... را کجا می‌گذارم؟

در Studio کپی کنید و در API داخل تنظیمات صدا به‌جای نام پیش‌ساخته بفرستید.

آیا خروجی واترمارک دارد؟

بله؛ بلاگ و مستندات به SynthID روی خروجی‌های Gemini Audio اشاره می‌کنند.

منابع

  1. Google Blog — Gemini 3.8 Text-to-Speech (۲۳ سپتامبر ۲۰۲۶): لینک بلاگ

  2. Gemini API — Speech generation: مستندات TTS

  3. Gemini API — Voice design: مستندات Voice design

  4. Google AI Studio — Gemini TTS: ورود به Studio

  5. فناوری‌کده — معرفی محصول: جمینای ۳.۸ فلش TTS چیست؟

برچسب‌ها:هوش مصنوعیجمینایگوگلمدل زبانی بزرگهوش مصنوعی مولدبرنامه‌نویسی
اشتراک‌گذاری:

مطالب مرتبط

عضویت در خبرنامه

آخرین اخبار هوش مصنوعی و فناوری را در ایمیل خود دریافت کنید.

پس از عضویت یک ایمیل تأیید برایتان ارسال می‌شود. هر زمان می‌توانید اشتراک خود را لغو کنید و ایمیل شما با شخص ثالثی به اشتراک گذاشته نمی‌شود.