پرش به محتوای اصلی
بررسی و نقد

بررسی Eleven v4 و v4 Turbo؛ نسل جدید صدای ElevenLabs

Eleven v4 و v4 Turbo مدل‌های TTS الون‌لبز؛ ۹۰+ زبان، تگ صوتی، کلون ۱۰ثانیه‌ای، قیمت معرفی تا ۱۲ اکتبر و مقایسه با Cartesia و جمینای — بدون ستاره جعلی.

۱۰ دقیقه مطالعه
اشتراک‌گذاری:
تصویر رسمی ElevenLabs در گزارش TechCrunch دربارهٔ انتشار مدل گفتار Eleven v4 — سپتامبر ۲۰۲۶
تصویر رسمی ElevenLabs در گزارش TechCrunch دربارهٔ انتشار مدل گفتار Eleven v4 — سپتامبر ۲۰۲۶
فهرست مطالب

Eleven v4 و برادر سریع‌ترش Eleven v4 Turbo دو مدل تبدیل متن به گفتار (Text-to-Speech یا TTS) هستند که ElevenLabs در ۲۸ سپتامبر ۲۰۲۶ منتشر کرد. v4 روی حس، کنترل اجرا و پایداری هویت صدا تمرکز دارد؛ Turbo همان نسل را برای مکالمهٔ زنده و عامل‌های صوتی با تأخیر کمتر تنظیم می‌کند. این مطلب بررسی نقش محصول است — بدون امتیاز ستاره‌ای جعلی. اعداد قیمت را از صفحه قیمت رسمی API و ادعاهای فنی را از بلاگ رسمی و گزارش TechCrunch گرفته‌ایم؛ ممکن است عوض شوند.

اگر مسیر گوگل را می‌خواهید، جمینای ۳.۸ فلش TTS چیست و آموزش Gemini TTS در AI Studio مکمل همین موضوع‌اند — رقیب قیمتی/کیفیتی، نه جایگزین یک‌به‌یک.

Eleven v4 چیست؟ پاسخ کوتاه

  • دو مدل هم‌زمان: Eleven v4 (شناسهٔ API: eleven_v4) برای روایت، دیالوگ و کاراکتر؛ Eleven v4 Turbo (eleven_v4_turbo) برای عامل صوتی و مکالمهٔ بلادرنگ.

  • معماری جدید نسبت به v3؛ کنترل با تگ‌های صوتی داخل متن (مثل خنده، نجوا، تأکید لهجه) و امکان روی‌هم‌چیدن چند تگ.

  • بیش از ۹۰ زبان (طبق اعلام شرکت؛ v3 حدود ۷۰+).

  • کلون فوری صدا از حدود ۱۰ ثانیه نمونه؛ کلون حرفه‌ای (Professional Voice Clone) دوباره روی v4 پشتیبانی می‌شود.

  • سقف حدود ۱۰٬۰۰۰ کاراکتر در هر درخواست تولید (طبق FAQ محصول).

  • قیمت API در دورهٔ معرفی تا ۱۲ اکتبر ۲۰۲۶: حدود ۰٫۰۲۲ دلار به ازای هر ۱٬۰۰۰ کاراکتر برای v4 و ۰٫۰۱۱ برای Turbo؛ بعد از آن طبق صفحه رسمی به ترتیب حدود ۰٫۰۸ و ۰٫۰۴ — مالیات جدا.

  • در تابلوی مستقل Artificial Analysis (Provider Voice Arena) در روز انتشار، شرکت و گزارش‌های ثانویه Eleven v4 را با Elo حدود ۱٬۳۱۹ در رتبهٔ اول نقل کرده‌اند؛ این عدد لحظه‌ای است و ممکن است جابه‌جا شود. Turbo جداگانه در آن نقل‌قول‌ها رتبه نداشت.

زمینه کوتاه: چرا نسل جدید صوت دوباره داغ شد؟

مدتی TTS فقط «متن را بخوان» بود. حالا تیم محصول می‌خواهد صدایی که در تبلیغ، بازی، پادکست یا خط پشتیبانی احساس داشته باشد، هویت گوینده را در فصل‌های بلند حفظ کند، و در مکالمهٔ تلفنی آن‌قدر دیر جواب ندهد که شنونده فکر کند خط قطع شده. رقیب‌هایی مثل Cartesia، Deepgram و مدل‌های صوتی گوگل و OpenAI هم در همین میدان‌اند. ElevenLabs با v4 شرط را روی «اجرای احساسی + کنترل کارگردانی داخل اسکریپت» گذاشته و با Turbo همان نسل را برای حلقهٔ عامل فشرده کرده — طبق روایت رسمی و پوشش TechCrunch.

Eleven v4: حس، بافت متن و تگ‌های صوتی

بلاگ رسمی می‌گوید مدل لحن، ریتم، شخصیت نوشته و بافت صحنه را می‌خواند تا جمله یک‌شکل و ربات‌مانند نماند. تگ‌های داخل متن (audio tags) که از v3 آمده بودند گسترده‌تر شده‌اند: می‌توانید چند دستور را پشت‌سرهم بگذارید — مثلاً نجوا بعد از آه، یا «با عصبانیت و لهجهٔ فرانسوی» — و حتی نشانه‌های محیطی مثل باران سبک یا زنگ گوشی. پشتیبانی IPA برای تلفظ سفارشی هم بهتر اعلام شده. برای تولیدکنندهٔ محتوا این یعنی کارگردانی داخل اسکریپت، نه فقط انتخاب یک صدای ثابت از کتابخانه.

نکتهٔ عملی: شرکت خودش می‌گوید معماری جدید است؛ پرامپت‌های قدیمی v3 را نقطهٔ شروع بدانید و دوباره تست کنید، نه جایگزینی تضمینی یک‌به‌یک.

Eleven v4 Turbo: سرعت برای عامل و مکالمه

Turbo برای جایی است که تأخیر شنیده می‌شود: پشتیبانی تلفنی، NPC بازی، دستیار فروش. شرکت میانهٔ تأخیر استنتاج را حدود ۱۰۰ میلی‌ثانیه و زمان تا اولین صدای شنیدنی را حدود ۱۵۰ میلی‌ثانیه اعلام کرده (اندازه‌گیری داخلی سپتامبر ۲۰۲۶، بدون شبکه). در صفحه محصول، همان عدد ۱۵۰ میلی‌ثانیه را کنار اعداد فروشنده برای Cartesia Sonic 3.6 (حدود ۲۶۲ms) و GPT-4o mini TTS (حدود ۸۱۴ms) نشان می‌دهد — این‌ها بنچمارک فروشنده است، نه آزمون مستقل ما. TechCrunch هم نوشته مدل می‌تواند به‌محض شروع تولید پاسخ توسط LLM پشت عامل، شروع به ساخت صدا کند.

اگر عامل می‌سازید، عدد را از منطقهٔ خودتان اندازه بگیرید؛ شبکه و صف می‌توانند فاصله را بزرگ کنند. Elo مستقل نقل‌شده مربوط به v4 کامل است، نه لزوماً Turbo.

زبان‌ها، کلون ۱۰ثانیه‌ای و پروژه‌های بلند

هر دو مدل بیش از ۹۰ زبان را پوشش می‌دهند. شرکت می‌گوید صدایی که در یک زبان ضبط شده می‌تواند زبان‌های دیگر را با لهجهٔ بومی‌تر از قبل بخواند و هویت اصلی را نگه دارد — ادعای فروشنده؛ برای دوبله و لوکال برند مهم است اگر در تست شما هم پایدار بماند. کلون فوری با حدود ۱۰ ثانیه نمونه، و کلون حرفه‌ای برای وفاداری بالاتر، هر دو با الزام رضایت تأییدشدهٔ صاحب صدا. سقف ۱۰٬۰۰۰ کاراکتر در هر تولید و «بخیه‌زنی بافت» بین قطعه‌ها برای کتاب صوتی و روایت بلند در FAQ محصول آمده؛ v3 معمولاً سقف کوتاه‌تری داشت.

قیمت API و پلن اشتراک (تأیید صفحه رسمی)

اعداد زیر از elevenlabs.io/pricing/api در ۲۹ سپتامبر ۲۰۲۶ (اروپا/برلین) خوانده شده‌اند. برچسب «۷۲٪ تخفیف تا ۱۲ اکتبر» کنار v4 و Turbo دیده می‌شود:

  • Eleven v4: ۰٫۰۲۲ دلار به ازای هر ۱٬۰۰۰ کاراکتر در دورهٔ معرفی؛ قیمت خط‌خوردهٔ لیست ۰٫۰۸.

  • Eleven v4 Turbo: ۰٫۰۱۱ در دورهٔ معرفی؛ لیست ۰٫۰۴.

  • Eleven v3: ۰٫۰۸؛ v3 Conversational: ۰٫۰۴؛ مدل‌های قدیمی Flash/Turbo: ۰٫۰۴.

  • پلن Starter شش‌دلاری در ماشین‌حساب همان صفحه حدود ۲۷۳ هزار کاراکتر v4 در نرخ معرفی (~۲۷۳ دقیقه) نشان می‌دهد؛ بعد از پایان تخفیف انتظار داشته باشید سهم کاراکتر به نرخ لیست نزدیک‌تر شود مگر شرکت خلافش را اعلام کند.

  • پلن رایگان همچنان حدود ۱۰٬۰۰۰ اعتبار/کاراکتر ماهانه برای تست شخصی اعلام شده.

مالیات جداست. برای استودیوی پرحجم بعد از ۱۲ اکتبر، هزینهٔ بلندمدت را با ۰٫۰۸ / ۰٫۰۴ حساب کنید و تخفیف را فقط پنجرهٔ تست بدانید.

جدول مقایسه (اعداد منبع‌دار، بدون ستاره)

Elo و فاصلهٔ رقبا از نقل‌قول‌های روز انتشار دربارهٔ تابلوی Artificial Analysis و جدول‌های ثانویهٔ هم‌زمان است؛ قبل از تصمیم نهایی دوباره تابلو را چک کنید. تأخیر Turbo ادعای شرکت است.

مدل

نقش اعلام‌شده

زبان (ادعا)

قیمت API تا ۱۲ اکتبر / بعد

نکته کیفیت یا تأخیر

Eleven v4

روایت، کاراکتر، کنترل اجرا

۹۰+

۰٫۰۲۲ → ۰٫۰۸ دلار / ۱K کاراکتر

Elo حدود ۱٬۳۱۹ در نقل روز انتشار (تابلوی مستقل؛ ممکن است تغییر کند)

Eleven v4 Turbo

عامل و مکالمهٔ زنده

۹۰+

۰٫۰۱۱ → ۰٫۰۴

~۱۰۰ms استنتاج / ~۱۵۰ms تا اولین صدا (اندازه‌گیری شرکت)

Eleven v3

نسل قبل احساسی

۷۰+

۰٫۰۸ ثابت

Elo حدود ۱٬۱۶۹ در همان نقل‌قول‌های روز انتشار

Cartesia Sonic 3.6

رقیب TTS سریع

—

~۴۹ دلار / ۱M کاراکتر (ستون قیمت تابلو در گزارش‌های ثانویه)

Elo حدود ۱٬۲۷۶؛ TTFS شرکت Eleven حدود ۲۶۲ms در چارت محصول

Gemini 3.8 Flash TTS

TTS گوگل؛ مسیر ارزان‌تر

—

~۱۶٫۵ دلار / ۱M کاراکتر (نقل تابلو/گزارش‌ها)

Elo حدود ۱٬۲۶۷؛ جزئیات محصول در مطالب جمینای TTS فناوری‌کده

قوت‌ها و محدودیت‌ها (بدون ستاره)

  • قوت: کنترل کارگردانی با تگ، پایداری بهتر هویت در ادعای شرکت، پوشش زبانی گسترده‌تر، پنجرهٔ قیمت معرفی جذاب برای تست کیفیت بالا، مسیر جدا برای عامل (Turbo).

  • قوت نسبی: اگر روی پلن ماهانه ElevenLabs هستید، در دو هفتهٔ تخفیف خروجی تمام‌شده را بچینید تا اعتبار بیشتر کش بیاید.

  • محدودیت: بعد از ۱۲ اکتبر قیمت لیست v4 نسبت به Gemini Flash TTS و حتی Cartesia گران‌تر است؛ برای روایت خنثی و پرتیراژ ممکن است صرفه‌جویی مهم‌تر از چند ده Elo باشد.

  • محدودیت: اعداد تأخیر و بخشی از بنچمارک‌های رودررو فروشنده‌اند؛ Turbo در نقل‌قول‌های Elo روز انتشار جدا رتبه نداشت.

  • محدودیت عملی: کلون صدا بدون رضایت قانونی خطرناک و غیرمجاز است؛ شرکت هم رضایت تأییدشده می‌خواهد.

نکته برای فارسی‌زبان‌ها

فارسی در فهرست «۹۰+ زبان» شرکت می‌گنجد، اما کیفیت لهجه، اعداد فارسی، نام‌های خاص و اصطلاحات فنی را خودتان با چند پاراگراف واقعی تست کنید — جدول جهانی جای گوش شما را نمی‌گیرد. برای تلفظ نام‌ها از دیکشنری تلفظ / IPA استفاده کنید. پرداخت دلاری و محدودیت‌های دسترسی منطقه‌ای را جدا از کیفیت مدل در نظر بگیرید؛ ما روش دور زدن تحریم پیشنهاد نمی‌کنیم. اگر فقط می‌خواهید در اکوسیستم گوگل صدا بسازید، مسیر آموزش Gemini TTS ساده‌تر است.

جمع‌بندی

Eleven v4 برای جایی است که «چطور گفته شود» به اندازهٔ «چه گفته شود» مهم است: نمایش صوتی، بازی، تبلیغ احساسی، کتاب با شخصیت پایدار. Turbo همان نسل را برای تماس و عامل می‌آورد، با این شرط که تأخیر را خودتان اندازه بگیرید. تا ۱۲ اکتبر ۲۰۲۶ قیمت معرفی فرصت خوبی برای A/B با v3 و با جمینای ۳.۸ فلش TTS است؛ بعد از آن حساب را با نرخ لیست ببندید. برندهٔ مطلق اعلام نمی‌کنیم — نقش و بودجه را روشن کنید.

پرسش‌های پرتکرار

فرق Eleven v4 با v4 Turbo چیست؟

v4 برای محتوای تولیدشده و حداکثر حس و کنترل؛ Turbo نسخهٔ کم‌تأخیر همان نسل برای عامل و مکالمهٔ زنده. هر دو ۹۰+ زبان و کلون حرفه‌ای را طبق FAQ محصول پشتیبانی می‌کنند؛ Turbo حدود نصف قیمت کاراکتری v4 است.

قیمت Eleven v4 چقدر است؟

روی API تا ۱۲ اکتبر ۲۰۲۶ حدود ۰٫۰۲۲ دلار به ازای هر ۱٬۰۰۰ کاراکتر؛ بعد طبق صفحه رسمی حدود ۰٫۰۸. Turbo: ۰٫۰۱۱ سپس ۰٫۰۴. مالیات جدا. پلن‌های اشتراکی از اعتبار ماهانه کم می‌کنند.

آیا Eleven v4 از Gemini TTS بهتر است؟

در نقل روز انتشار تابلوی Artificial Analysis، Elo v4 بالاتر از جمینای ۳.۸ فلش TTS گزارش شده؛ قیمت لیست v4 بعد از تخفیف خیلی بالاتر است. برای کار احساسی/کاراکتر ممکن است اختلاف کیفیت بیارزد؛ برای تیراژ خنثی اغلب قیمت جمینای جذاب‌تر است. خودتان با همان اسکریپت مقایسه کنید.

تگ‌های صوتی v3 در v4 کار می‌کنند؟

syntax تگ‌ها ادامه دارد و روی‌هم‌چینی بهتر شده؛ چون معماری جدید است خروجی را دوباره گوش دهید.

برای کلون صدا چند ثانیه لازم است؟

کلون فوری حدود ۱۰ ثانیه؛ کلون حرفه‌ای نمونهٔ طولانی‌تر. رضایت تأییدشدهٔ صاحب صدا الزامی است.

چند زبان پشتیبانی می‌شود؟

طبق اعلام ElevenLabs بیش از ۹۰. پرش کیفیت در ژاپنی، پرتغالی برزیلی، ماندارین و کانتونی در پوشش TechCrunch برجسته شده.

از ایران می‌توانم استفاده کنم؟

دسترسی، پرداخت و قوانین محلی را خودتان بررسی کنید؛ ما روش دور زدن محدودیت پیشنهاد نمی‌دهیم. کیفیت فارسی را با نمونهٔ واقعی بسنجید.

کجا شروع کنم؟

حساب رایگان در elevenlabs.io، انتخاب مدل v4 یا Turbo در بخش TTS یا Agents، چند پاراگراف با تگ و بدون تگ، و مقایسه با مسیر گوگل اگر بودجه اولویت است.

منابع

برچسب‌ها:هوش مصنوعیهوش مصنوعی مولدمدل زبانی بزرگ
اشتراک‌گذاری:

مطالب مرتبط

عضویت در خبرنامه

آخرین اخبار هوش مصنوعی و فناوری را در ایمیل خود دریافت کنید.

پس از عضویت یک ایمیل تأیید برایتان ارسال می‌شود. هر زمان می‌توانید اشتراک خود را لغو کنید و ایمیل شما با شخص ثالثی به اشتراک گذاشته نمی‌شود.