فهرست مطالب
Eleven v4 و برادر سریعترش Eleven v4 Turbo دو مدل تبدیل متن به گفتار (Text-to-Speech یا TTS) هستند که ElevenLabs در ۲۸ سپتامبر ۲۰۲۶ منتشر کرد. v4 روی حس، کنترل اجرا و پایداری هویت صدا تمرکز دارد؛ Turbo همان نسل را برای مکالمهٔ زنده و عاملهای صوتی با تأخیر کمتر تنظیم میکند. این مطلب بررسی نقش محصول است — بدون امتیاز ستارهای جعلی. اعداد قیمت را از صفحه قیمت رسمی API و ادعاهای فنی را از بلاگ رسمی و گزارش TechCrunch گرفتهایم؛ ممکن است عوض شوند.
اگر مسیر گوگل را میخواهید، جمینای ۳.۸ فلش TTS چیست و آموزش Gemini TTS در AI Studio مکمل همین موضوعاند — رقیب قیمتی/کیفیتی، نه جایگزین یکبهیک.
Eleven v4 چیست؟ پاسخ کوتاه
دو مدل همزمان: Eleven v4 (شناسهٔ API: eleven_v4) برای روایت، دیالوگ و کاراکتر؛ Eleven v4 Turbo (eleven_v4_turbo) برای عامل صوتی و مکالمهٔ بلادرنگ.
معماری جدید نسبت به v3؛ کنترل با تگهای صوتی داخل متن (مثل خنده، نجوا، تأکید لهجه) و امکان رویهمچیدن چند تگ.
بیش از ۹۰ زبان (طبق اعلام شرکت؛ v3 حدود ۷۰+).
کلون فوری صدا از حدود ۱۰ ثانیه نمونه؛ کلون حرفهای (Professional Voice Clone) دوباره روی v4 پشتیبانی میشود.
سقف حدود ۱۰٬۰۰۰ کاراکتر در هر درخواست تولید (طبق FAQ محصول).
قیمت API در دورهٔ معرفی تا ۱۲ اکتبر ۲۰۲۶: حدود ۰٫۰۲۲ دلار به ازای هر ۱٬۰۰۰ کاراکتر برای v4 و ۰٫۰۱۱ برای Turbo؛ بعد از آن طبق صفحه رسمی به ترتیب حدود ۰٫۰۸ و ۰٫۰۴ — مالیات جدا.
در تابلوی مستقل Artificial Analysis (Provider Voice Arena) در روز انتشار، شرکت و گزارشهای ثانویه Eleven v4 را با Elo حدود ۱٬۳۱۹ در رتبهٔ اول نقل کردهاند؛ این عدد لحظهای است و ممکن است جابهجا شود. Turbo جداگانه در آن نقلقولها رتبه نداشت.
زمینه کوتاه: چرا نسل جدید صوت دوباره داغ شد؟
مدتی TTS فقط «متن را بخوان» بود. حالا تیم محصول میخواهد صدایی که در تبلیغ، بازی، پادکست یا خط پشتیبانی احساس داشته باشد، هویت گوینده را در فصلهای بلند حفظ کند، و در مکالمهٔ تلفنی آنقدر دیر جواب ندهد که شنونده فکر کند خط قطع شده. رقیبهایی مثل Cartesia، Deepgram و مدلهای صوتی گوگل و OpenAI هم در همین میداناند. ElevenLabs با v4 شرط را روی «اجرای احساسی + کنترل کارگردانی داخل اسکریپت» گذاشته و با Turbo همان نسل را برای حلقهٔ عامل فشرده کرده — طبق روایت رسمی و پوشش TechCrunch.
Eleven v4: حس، بافت متن و تگهای صوتی
بلاگ رسمی میگوید مدل لحن، ریتم، شخصیت نوشته و بافت صحنه را میخواند تا جمله یکشکل و رباتمانند نماند. تگهای داخل متن (audio tags) که از v3 آمده بودند گستردهتر شدهاند: میتوانید چند دستور را پشتسرهم بگذارید — مثلاً نجوا بعد از آه، یا «با عصبانیت و لهجهٔ فرانسوی» — و حتی نشانههای محیطی مثل باران سبک یا زنگ گوشی. پشتیبانی IPA برای تلفظ سفارشی هم بهتر اعلام شده. برای تولیدکنندهٔ محتوا این یعنی کارگردانی داخل اسکریپت، نه فقط انتخاب یک صدای ثابت از کتابخانه.
نکتهٔ عملی: شرکت خودش میگوید معماری جدید است؛ پرامپتهای قدیمی v3 را نقطهٔ شروع بدانید و دوباره تست کنید، نه جایگزینی تضمینی یکبهیک.
Eleven v4 Turbo: سرعت برای عامل و مکالمه
Turbo برای جایی است که تأخیر شنیده میشود: پشتیبانی تلفنی، NPC بازی، دستیار فروش. شرکت میانهٔ تأخیر استنتاج را حدود ۱۰۰ میلیثانیه و زمان تا اولین صدای شنیدنی را حدود ۱۵۰ میلیثانیه اعلام کرده (اندازهگیری داخلی سپتامبر ۲۰۲۶، بدون شبکه). در صفحه محصول، همان عدد ۱۵۰ میلیثانیه را کنار اعداد فروشنده برای Cartesia Sonic 3.6 (حدود ۲۶۲ms) و GPT-4o mini TTS (حدود ۸۱۴ms) نشان میدهد — اینها بنچمارک فروشنده است، نه آزمون مستقل ما. TechCrunch هم نوشته مدل میتواند بهمحض شروع تولید پاسخ توسط LLM پشت عامل، شروع به ساخت صدا کند.
اگر عامل میسازید، عدد را از منطقهٔ خودتان اندازه بگیرید؛ شبکه و صف میتوانند فاصله را بزرگ کنند. Elo مستقل نقلشده مربوط به v4 کامل است، نه لزوماً Turbo.
زبانها، کلون ۱۰ثانیهای و پروژههای بلند
هر دو مدل بیش از ۹۰ زبان را پوشش میدهند. شرکت میگوید صدایی که در یک زبان ضبط شده میتواند زبانهای دیگر را با لهجهٔ بومیتر از قبل بخواند و هویت اصلی را نگه دارد — ادعای فروشنده؛ برای دوبله و لوکال برند مهم است اگر در تست شما هم پایدار بماند. کلون فوری با حدود ۱۰ ثانیه نمونه، و کلون حرفهای برای وفاداری بالاتر، هر دو با الزام رضایت تأییدشدهٔ صاحب صدا. سقف ۱۰٬۰۰۰ کاراکتر در هر تولید و «بخیهزنی بافت» بین قطعهها برای کتاب صوتی و روایت بلند در FAQ محصول آمده؛ v3 معمولاً سقف کوتاهتری داشت.
قیمت API و پلن اشتراک (تأیید صفحه رسمی)
اعداد زیر از elevenlabs.io/pricing/api در ۲۹ سپتامبر ۲۰۲۶ (اروپا/برلین) خوانده شدهاند. برچسب «۷۲٪ تخفیف تا ۱۲ اکتبر» کنار v4 و Turbo دیده میشود:
Eleven v4: ۰٫۰۲۲ دلار به ازای هر ۱٬۰۰۰ کاراکتر در دورهٔ معرفی؛ قیمت خطخوردهٔ لیست ۰٫۰۸.
Eleven v4 Turbo: ۰٫۰۱۱ در دورهٔ معرفی؛ لیست ۰٫۰۴.
Eleven v3: ۰٫۰۸؛ v3 Conversational: ۰٫۰۴؛ مدلهای قدیمی Flash/Turbo: ۰٫۰۴.
پلن Starter ششدلاری در ماشینحساب همان صفحه حدود ۲۷۳ هزار کاراکتر v4 در نرخ معرفی (~۲۷۳ دقیقه) نشان میدهد؛ بعد از پایان تخفیف انتظار داشته باشید سهم کاراکتر به نرخ لیست نزدیکتر شود مگر شرکت خلافش را اعلام کند.
پلن رایگان همچنان حدود ۱۰٬۰۰۰ اعتبار/کاراکتر ماهانه برای تست شخصی اعلام شده.
مالیات جداست. برای استودیوی پرحجم بعد از ۱۲ اکتبر، هزینهٔ بلندمدت را با ۰٫۰۸ / ۰٫۰۴ حساب کنید و تخفیف را فقط پنجرهٔ تست بدانید.
جدول مقایسه (اعداد منبعدار، بدون ستاره)
Elo و فاصلهٔ رقبا از نقلقولهای روز انتشار دربارهٔ تابلوی Artificial Analysis و جدولهای ثانویهٔ همزمان است؛ قبل از تصمیم نهایی دوباره تابلو را چک کنید. تأخیر Turbo ادعای شرکت است.
مدل | نقش اعلامشده | زبان (ادعا) | قیمت API تا ۱۲ اکتبر / بعد | نکته کیفیت یا تأخیر |
|---|---|---|---|---|
Eleven v4 | روایت، کاراکتر، کنترل اجرا | ۹۰+ | ۰٫۰۲۲ → ۰٫۰۸ دلار / ۱K کاراکتر | Elo حدود ۱٬۳۱۹ در نقل روز انتشار (تابلوی مستقل؛ ممکن است تغییر کند) |
Eleven v4 Turbo | عامل و مکالمهٔ زنده | ۹۰+ | ۰٫۰۱۱ → ۰٫۰۴ | ~۱۰۰ms استنتاج / ~۱۵۰ms تا اولین صدا (اندازهگیری شرکت) |
Eleven v3 | نسل قبل احساسی | ۷۰+ | ۰٫۰۸ ثابت | Elo حدود ۱٬۱۶۹ در همان نقلقولهای روز انتشار |
Cartesia Sonic 3.6 | رقیب TTS سریع | — | ~۴۹ دلار / ۱M کاراکتر (ستون قیمت تابلو در گزارشهای ثانویه) | Elo حدود ۱٬۲۷۶؛ TTFS شرکت Eleven حدود ۲۶۲ms در چارت محصول |
Gemini 3.8 Flash TTS | TTS گوگل؛ مسیر ارزانتر | — | ~۱۶٫۵ دلار / ۱M کاراکتر (نقل تابلو/گزارشها) | Elo حدود ۱٬۲۶۷؛ جزئیات محصول در مطالب جمینای TTS فناوریکده |
قوتها و محدودیتها (بدون ستاره)
قوت: کنترل کارگردانی با تگ، پایداری بهتر هویت در ادعای شرکت، پوشش زبانی گستردهتر، پنجرهٔ قیمت معرفی جذاب برای تست کیفیت بالا، مسیر جدا برای عامل (Turbo).
قوت نسبی: اگر روی پلن ماهانه ElevenLabs هستید، در دو هفتهٔ تخفیف خروجی تمامشده را بچینید تا اعتبار بیشتر کش بیاید.
محدودیت: بعد از ۱۲ اکتبر قیمت لیست v4 نسبت به Gemini Flash TTS و حتی Cartesia گرانتر است؛ برای روایت خنثی و پرتیراژ ممکن است صرفهجویی مهمتر از چند ده Elo باشد.
محدودیت: اعداد تأخیر و بخشی از بنچمارکهای رودررو فروشندهاند؛ Turbo در نقلقولهای Elo روز انتشار جدا رتبه نداشت.
محدودیت عملی: کلون صدا بدون رضایت قانونی خطرناک و غیرمجاز است؛ شرکت هم رضایت تأییدشده میخواهد.
نکته برای فارسیزبانها
فارسی در فهرست «۹۰+ زبان» شرکت میگنجد، اما کیفیت لهجه، اعداد فارسی، نامهای خاص و اصطلاحات فنی را خودتان با چند پاراگراف واقعی تست کنید — جدول جهانی جای گوش شما را نمیگیرد. برای تلفظ نامها از دیکشنری تلفظ / IPA استفاده کنید. پرداخت دلاری و محدودیتهای دسترسی منطقهای را جدا از کیفیت مدل در نظر بگیرید؛ ما روش دور زدن تحریم پیشنهاد نمیکنیم. اگر فقط میخواهید در اکوسیستم گوگل صدا بسازید، مسیر آموزش Gemini TTS سادهتر است.
جمعبندی
Eleven v4 برای جایی است که «چطور گفته شود» به اندازهٔ «چه گفته شود» مهم است: نمایش صوتی، بازی، تبلیغ احساسی، کتاب با شخصیت پایدار. Turbo همان نسل را برای تماس و عامل میآورد، با این شرط که تأخیر را خودتان اندازه بگیرید. تا ۱۲ اکتبر ۲۰۲۶ قیمت معرفی فرصت خوبی برای A/B با v3 و با جمینای ۳.۸ فلش TTS است؛ بعد از آن حساب را با نرخ لیست ببندید. برندهٔ مطلق اعلام نمیکنیم — نقش و بودجه را روشن کنید.
پرسشهای پرتکرار
فرق Eleven v4 با v4 Turbo چیست؟
v4 برای محتوای تولیدشده و حداکثر حس و کنترل؛ Turbo نسخهٔ کمتأخیر همان نسل برای عامل و مکالمهٔ زنده. هر دو ۹۰+ زبان و کلون حرفهای را طبق FAQ محصول پشتیبانی میکنند؛ Turbo حدود نصف قیمت کاراکتری v4 است.
قیمت Eleven v4 چقدر است؟
روی API تا ۱۲ اکتبر ۲۰۲۶ حدود ۰٫۰۲۲ دلار به ازای هر ۱٬۰۰۰ کاراکتر؛ بعد طبق صفحه رسمی حدود ۰٫۰۸. Turbo: ۰٫۰۱۱ سپس ۰٫۰۴. مالیات جدا. پلنهای اشتراکی از اعتبار ماهانه کم میکنند.
آیا Eleven v4 از Gemini TTS بهتر است؟
در نقل روز انتشار تابلوی Artificial Analysis، Elo v4 بالاتر از جمینای ۳.۸ فلش TTS گزارش شده؛ قیمت لیست v4 بعد از تخفیف خیلی بالاتر است. برای کار احساسی/کاراکتر ممکن است اختلاف کیفیت بیارزد؛ برای تیراژ خنثی اغلب قیمت جمینای جذابتر است. خودتان با همان اسکریپت مقایسه کنید.
تگهای صوتی v3 در v4 کار میکنند؟
syntax تگها ادامه دارد و رویهمچینی بهتر شده؛ چون معماری جدید است خروجی را دوباره گوش دهید.
برای کلون صدا چند ثانیه لازم است؟
کلون فوری حدود ۱۰ ثانیه؛ کلون حرفهای نمونهٔ طولانیتر. رضایت تأییدشدهٔ صاحب صدا الزامی است.
چند زبان پشتیبانی میشود؟
طبق اعلام ElevenLabs بیش از ۹۰. پرش کیفیت در ژاپنی، پرتغالی برزیلی، ماندارین و کانتونی در پوشش TechCrunch برجسته شده.
از ایران میتوانم استفاده کنم؟
دسترسی، پرداخت و قوانین محلی را خودتان بررسی کنید؛ ما روش دور زدن محدودیت پیشنهاد نمیدهیم. کیفیت فارسی را با نمونهٔ واقعی بسنجید.
کجا شروع کنم؟
حساب رایگان در elevenlabs.io، انتخاب مدل v4 یا Turbo در بخش TTS یا Agents، چند پاراگراف با تگ و بدون تگ، و مقایسه با مسیر گوگل اگر بودجه اولویت است.
منابع
ElevenLabs — Introducing Eleven v4: elevenlabs.io/blog/eleven-v4
ElevenLabs — صفحه محصول v4: elevenlabs.io/v4
ElevenLabs — قیمت API: elevenlabs.io/pricing/api
TechCrunch — گزارش انتشار ۲۸ سپتامبر ۲۰۲۶: techcrunch.com/…/elevenlabs-new-v4-speech-model…
Artificial Analysis — مدلهای گفتار (برای چک مجدد Elo): artificialanalysis.ai/text-to-speech/models
فناوریکده — جمینای ۳.۸ فلش TTS: fanavarikade.com/fa/news/gemini-3-8-flash-tts-chist
فناوریکده — آموزش Gemini TTS: fanavarikade.com/fa/news/gemini-tts-amouzesh-ai-studio



