جمینای ۳.۸ لایو چیست؟ راهنمای کامل مدل گفتوگوی صوتی جدید گوگل

اگر تا الان بیشتر با چت متنی کار کردهاید، خبر جدید گوگل ممکن است کمی گنگ به نظر برسد: Gemini 3.8 Live و نسخه قویترش یعنی Live Extended Thinking. در این مطلب اول میگوییم جمینای اصلاً چیست؛ بعد توضیح میدهیم مدل «زنده» چه فرقی با چت عادی دارد؛ و در پایان خبر ۱۵ سپتامبر ۲۰۲۶ را کامل باز میکنیم.
زمینه: جمینای چیست و چرا باید بشناسیمش؟
Google و خانواده جمینای
جمینای (Gemini) نام خانواده مدلهای هوش مصنوعی گوگل است؛ رقیب مستقیم ابزارهایی مثل ChatGPT. جمینای داخل اپ جمینای، جستجوی گوگل، و بسیاری از سرویسهای Workspace (مثل Docs و Gmail) دیده میشود.
چت متنی در برابر گفتوگوی زنده
در چت متنی، شما مینویسید و مدل جواب مینویسد. در گفتوگوی زنده (Live)، ارتباط بیشتر شبیه مکالمه تلفنی یا تماس تصویری است: حرف میزنید، مدل همزمان گوش میدهد، وسط حرف میتوانید قطعش کنید، و گاهی آنچه روی صفحه یا دوربین میبیند را هم وارد گفتوگو میکند.
عامل صوتی یعنی چه؟
وقتی مدل فقط حرف نزند بلکه در پسزمینه ابزارها را صدا بزند — مثلاً قرار رزرو کند، ایمیلی آماده کند، یا چند قدم از یک کار را انجام دهد — به آن نزدیک میشویم به عامل صوتی. نسخه Extended Thinking دقیقاً برای همین کارهای پیچیدهتر معرفی شده است.
خبر: گوگل دو مدل Live جدید معرفی کرد
در ۱۵ سپتامبر ۲۰۲۶، گوگل از دو مدل رونمایی کرد:
1. Gemini 3.8 Live — برای مقیاس بالا و هزینه مناسبتر؛ مکالمه روان بههمراه درک بصری نزدیک به زمان واقعی
2. Gemini 3.8 Live Extended Thinking — برای کارهای سنگینتر؛ استدلال چندمرحلهای همزمان با صحبت
شرکت میگوید این مدلها مکالمه را طبیعیتر میکنند: قطع شدن حرف، عوض کردن زبان وسط گفتوگو، و ادامه کار در پسزمینه بدون اینکه مکالمه قطع شود.
چه قابلیتهایی برجسته شده؟
طبق اعلام رسمی گوگل:
- پشتیبانی از جابهجایی بین حدود ۹۷ زبان در میانه مکالمه
- پردازش ورودی تصویری نزدیک به زمان واقعی (مثلاً آنچه میبینید را وارد گفتوگو کند)
- اجرای ابزار و فراخوانی API در پسزمینه، در حالی که گفتوگو ادامه دارد
- در نسخه Extended Thinking: نشانههای کلامی طبیعی مثل «بگذار چک کنم…» و روایت پیشرفت کار
- واترمارک صوتی SynthID روی خروجی صوتی تولیدشده برای شفافیت بیشتر درباره محتوای ساختهشده با هوش مصنوعی
گوگل همچنین ادعا کرده نسخه Extended Thinking در شاخص کیفیت Speech-to-Speech سایت Artificial Analysis رتبه اول (حدود ۸۲٫۶) گرفته و در بنچمارکهای عامل صوتی نتایج قوی داشته است. مثل همیشه، بنچمارکهای اعلامی شرکت را باید با سنجشهای مستقل هم مقایسه کرد.
کجا میتوانید امتحانش کنید؟
طبق پست رسمی:
- توسعهدهندگان: از مسیر Gemini API و Google AI Studio
- کاربران عادی: در تجربههایی مثل Search Live و Gemini Live
- سازمانها: پیشنمایش خصوصی در Gemini Enterprise و گسترش تدریجی به Workspace
این یعنی اگر اپ جمینای یا جستجوی زنده گوگل را دارید، بهتدریج باید کیفیت مکالمه صوتی و همکاری روی کارهای چندمرحلهای را بهتر حس کنید.
چرا این خبر مهم است؟
تا همین یکیدو سال پیش، گفتوگوی صوتی با هوش مصنوعی بیشتر شبیه «دیکته + پاسخ کوتاه» بود. نسل Live فعلی میخواهد حس یک همکار مکالمهای بدهد: بشنود، ببیند، وسط کار ابزار صدا بزند، و همزمان توضیح بدهد چه میکند.
برای کسبوکارها، پیام روشن است: پشتیبانی تلفنی، آموزش کارکنان، و رابطهای بدون صفحه کلید دیگر آزمایش لوکس نیستند؛ به محصول واقعی نزدیکتر شدهاند. برای توسعهدهندگان فارسیزبان هم یعنی طراحی تجربه صوتی — با تأخیر کم، مدیریت قطع صحبت، و فراخوانی ابزار — مهارت پرتقاضاتری میشود.
نکته کاربردی برای خواننده فارسیزبان
- اگر پشتیبانی مشتری یا آموزش آنلاین دارید، سناریوی «تماس صوتی + انجام کار در پسزمینه» را جدیتر ارزیابی کنید.
- برای محتوای آموزشی، مدل Live میتواند توضیح همزمان با نشان دادن صفحه یا پیشنویس را سادهتر کند.
- به موضوع واترمارک و شفافیت محتوای مصنوعی توجه کنید؛ بهویژه اگر محتوا عمومی منتشر میکنید.
- کیفیت فارسی و جابهجایی زبان را خودتان تست کنید؛ عدد «۹۷ زبان» بهمعنای کیفیت یکسان همه زبانها نیست.
جمعبندی
جمینای ۳.۸ لایو نسل تازهای از گفتوگوی نزدیک به زمان واقعی گوگل است و نسخه Extended Thinking همان مسیر را برای کارهای پیچیدهتر جلو میبرد. خبر ۱۵ سپتامبر ۲۰۲۶ بیشتر از یک آپدیت صوتی ساده است: قدمی بهسمت عاملهای صوتی تولیدی در محصولهای روزمره گوگل.
اگر دوست دارید تفاوت مدلهای «سریع و ارزان» جمینای با نسخه سایبریاش را هم بدانید، مطلب جداگانه Flash و Flash Cyber را در فناوریکده بخوانید.
تجربه واقعی کاربر ممکن است چطور باشد؟
تصور کنید در آشپزخانه هستید و میپرسید شام چه درست کنید. مدل Live فقط لیست مواد نمیدهد؛ ممکن است بپرسد چقدر وقت دارید، از دوربین ببیند چه چیزی در یخچال هست، و همزمان که حرف میزنید یک فهرست خرید در پسزمینه بسازد. این همان حسی است که گوگل سعی دارد بسازد: مکالمه طبیعی بهعلاوه کار واقعی.
البته کیفیت این تجربه به اینترنت، مجوز میکروفون و دوربین، زبان، و محدودیتهای حساب کاربری بستگی دارد. در فارسی باید خودتان امتحان کنید؛ ادعاهای چندزبانه همیشه بهمعنای کیفیت یکسان نیستند. اگر چیزی درست نشنید، مکالمه را کوتاهتر و دستورها را مشخصتر کنید تا نتیجه بهتر شود.
چه کسانی باید همین هفته تست کنند؟
اگر پشتیبانی تلفنی، آموزش آنلاین، یا محصول دستیار صوتی دارید، این مدل را در فهرست آزمایش هفته بگذارید. سناریوهای کوتاه طراحی کنید: قطع حرف کاربر، عوض کردن زبان، و درخواست انجام کار در پسزمینه. نتیجه را با مدل صوتی قبلیتان مقایسه کنید؛ نه با تبلیغات بنچمارک.
برای معلمها و تولیدکنندگان محتوا هم ارزش آزمایش دارد، به شرطی که حریم تصویر و صدای افراد را رعایت کنید. گفتوگوی زنده با دوربین میتواند مفید باشد، اما رضایت و شفافیت را جدی بگیرید.
منابع
1. Google Blog — Gemini 3.8 Live و Extended Thinking (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/)

