پرش به محتوای اصلی
اخبار هوش مصنوعی

جمینای ۳.۸ لایو چیست؟ راهنمای کامل مدل گفت‌وگوی صوتی جدید گوگل

جمینای ۳.۸ لایو چیست؟ راهنمای کامل مدل گفت‌وگوی صوتی جدید گوگل

اگر تا الان بیشتر با چت متنی کار کرده‌اید، خبر جدید گوگل ممکن است کمی گنگ به نظر برسد: Gemini 3.8 Live و نسخه قوی‌ترش یعنی Live Extended Thinking. در این مطلب اول می‌گوییم جمینای اصلاً چیست؛ بعد توضیح می‌دهیم مدل «زنده» چه فرقی با چت عادی دارد؛ و در پایان خبر ۱۵ سپتامبر ۲۰۲۶ را کامل باز می‌کنیم.

زمینه: جمینای چیست و چرا باید بشناسیمش؟

Google و خانواده جمینای

جمینای (Gemini) نام خانواده مدل‌های هوش مصنوعی گوگل است؛ رقیب مستقیم ابزارهایی مثل ChatGPT. جمینای داخل اپ جمینای، جستجوی گوگل، و بسیاری از سرویس‌های Workspace (مثل Docs و Gmail) دیده می‌شود.

چت متنی در برابر گفت‌وگوی زنده

در چت متنی، شما می‌نویسید و مدل جواب می‌نویسد. در گفت‌وگوی زنده (Live)، ارتباط بیشتر شبیه مکالمه تلفنی یا تماس تصویری است: حرف می‌زنید، مدل هم‌زمان گوش می‌دهد، وسط حرف می‌توانید قطعش کنید، و گاهی آنچه روی صفحه یا دوربین می‌بیند را هم وارد گفت‌وگو می‌کند.

عامل صوتی یعنی چه؟

وقتی مدل فقط حرف نزند بلکه در پس‌زمینه ابزارها را صدا بزند — مثلاً قرار رزرو کند، ایمیلی آماده کند، یا چند قدم از یک کار را انجام دهد — به آن نزدیک می‌شویم به عامل صوتی. نسخه Extended Thinking دقیقاً برای همین کارهای پیچیده‌تر معرفی شده است.

خبر: گوگل دو مدل Live جدید معرفی کرد

در ۱۵ سپتامبر ۲۰۲۶، گوگل از دو مدل رونمایی کرد:

1. Gemini 3.8 Live — برای مقیاس بالا و هزینه مناسب‌تر؛ مکالمه روان به‌همراه درک بصری نزدیک به زمان واقعی

2. Gemini 3.8 Live Extended Thinking — برای کارهای سنگین‌تر؛ استدلال چندمرحله‌ای همزمان با صحبت

شرکت می‌گوید این مدل‌ها مکالمه را طبیعی‌تر می‌کنند: قطع شدن حرف، عوض کردن زبان وسط گفت‌وگو، و ادامه کار در پس‌زمینه بدون اینکه مکالمه قطع شود.

چه قابلیت‌هایی برجسته شده؟

طبق اعلام رسمی گوگل:

- پشتیبانی از جابه‌جایی بین حدود ۹۷ زبان در میانه مکالمه

- پردازش ورودی تصویری نزدیک به زمان واقعی (مثلاً آنچه می‌بینید را وارد گفت‌وگو کند)

- اجرای ابزار و فراخوانی API در پس‌زمینه، در حالی که گفت‌وگو ادامه دارد

- در نسخه Extended Thinking: نشانه‌های کلامی طبیعی مثل «بگذار چک کنم…» و روایت پیشرفت کار

- واترمارک صوتی SynthID روی خروجی صوتی تولیدشده برای شفافیت بیشتر درباره محتوای ساخته‌شده با هوش مصنوعی

گوگل همچنین ادعا کرده نسخه Extended Thinking در شاخص کیفیت Speech-to-Speech سایت Artificial Analysis رتبه اول (حدود ۸۲٫۶) گرفته و در بنچمارک‌های عامل صوتی نتایج قوی داشته است. مثل همیشه، بنچمارک‌های اعلامی شرکت را باید با سنجش‌های مستقل هم مقایسه کرد.

کجا می‌توانید امتحانش کنید؟

طبق پست رسمی:

- توسعه‌دهندگان: از مسیر Gemini API و Google AI Studio

- کاربران عادی: در تجربه‌هایی مثل Search Live و Gemini Live

- سازمان‌ها: پیش‌نمایش خصوصی در Gemini Enterprise و گسترش تدریجی به Workspace

این یعنی اگر اپ جمینای یا جستجوی زنده گوگل را دارید، به‌تدریج باید کیفیت مکالمه صوتی و همکاری روی کارهای چندمرحله‌ای را بهتر حس کنید.

چرا این خبر مهم است؟

تا همین یکی‌دو سال پیش، گفت‌وگوی صوتی با هوش مصنوعی بیشتر شبیه «دیکته + پاسخ کوتاه» بود. نسل Live فعلی می‌خواهد حس یک همکار مکالمه‌ای بدهد: بشنود، ببیند، وسط کار ابزار صدا بزند، و همزمان توضیح بدهد چه می‌کند.

برای کسب‌وکارها، پیام روشن است: پشتیبانی تلفنی، آموزش کارکنان، و رابط‌های بدون صفحه کلید دیگر آزمایش لوکس نیستند؛ به محصول واقعی نزدیک‌تر شده‌اند. برای توسعه‌دهندگان فارسی‌زبان هم یعنی طراحی تجربه صوتی — با تأخیر کم، مدیریت قطع صحبت، و فراخوانی ابزار — مهارت پرتقاضاتری می‌شود.

نکته کاربردی برای خواننده فارسی‌زبان

- اگر پشتیبانی مشتری یا آموزش آنلاین دارید، سناریوی «تماس صوتی + انجام کار در پس‌زمینه» را جدی‌تر ارزیابی کنید.

- برای محتوای آموزشی، مدل Live می‌تواند توضیح همزمان با نشان دادن صفحه یا پیش‌نویس را ساده‌تر کند.

- به موضوع واترمارک و شفافیت محتوای مصنوعی توجه کنید؛ به‌ویژه اگر محتوا عمومی منتشر می‌کنید.

- کیفیت فارسی و جابه‌جایی زبان را خودتان تست کنید؛ عدد «۹۷ زبان» به‌معنای کیفیت یکسان همه زبان‌ها نیست.

جمع‌بندی

جمینای ۳.۸ لایو نسل تازه‌ای از گفت‌وگوی نزدیک به زمان واقعی گوگل است و نسخه Extended Thinking همان مسیر را برای کارهای پیچیده‌تر جلو می‌برد. خبر ۱۵ سپتامبر ۲۰۲۶ بیشتر از یک آپدیت صوتی ساده است: قدمی به‌سمت عامل‌های صوتی تولیدی در محصول‌های روزمره گوگل.

اگر دوست دارید تفاوت مدل‌های «سریع و ارزان» جمینای با نسخه سایبری‌اش را هم بدانید، مطلب جداگانه Flash و Flash Cyber را در فناوری‌کده بخوانید.

تجربه واقعی کاربر ممکن است چطور باشد؟

تصور کنید در آشپزخانه هستید و می‌پرسید شام چه درست کنید. مدل Live فقط لیست مواد نمی‌دهد؛ ممکن است بپرسد چقدر وقت دارید، از دوربین ببیند چه چیزی در یخچال هست، و هم‌زمان که حرف می‌زنید یک فهرست خرید در پس‌زمینه بسازد. این همان حسی است که گوگل سعی دارد بسازد: مکالمه طبیعی به‌علاوه کار واقعی.

البته کیفیت این تجربه به اینترنت، مجوز میکروفون و دوربین، زبان، و محدودیت‌های حساب کاربری بستگی دارد. در فارسی باید خودتان امتحان کنید؛ ادعاهای چندزبانه همیشه به‌معنای کیفیت یکسان نیستند. اگر چیزی درست نشنید، مکالمه را کوتاه‌تر و دستورها را مشخص‌تر کنید تا نتیجه بهتر شود.

چه کسانی باید همین هفته تست کنند؟

اگر پشتیبانی تلفنی، آموزش آنلاین، یا محصول دستیار صوتی دارید، این مدل را در فهرست آزمایش هفته بگذارید. سناریوهای کوتاه طراحی کنید: قطع حرف کاربر، عوض کردن زبان، و درخواست انجام کار در پس‌زمینه. نتیجه را با مدل صوتی قبلی‌تان مقایسه کنید؛ نه با تبلیغات بنچمارک.

برای معلم‌ها و تولیدکنندگان محتوا هم ارزش آزمایش دارد، به شرطی که حریم تصویر و صدای افراد را رعایت کنید. گفت‌وگوی زنده با دوربین می‌تواند مفید باشد، اما رضایت و شفافیت را جدی بگیرید.

منابع

1. Google Blog — Gemini 3.8 Live و Extended Thinking (https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/)

برچسب‌ها:هوش مصنوعیجمینایگوگلهوش مصنوعی مولدمدل زبانی بزرگ
بازگشت به اخبار

عضویت در خبرنامه

آخرین اخبار هوش مصنوعی و فناوری را در ایمیل خود دریافت کنید.

پس از عضویت یک ایمیل تأیید برایتان ارسال می‌شود. هر زمان می‌توانید اشتراک خود را لغو کنید و ایمیل شما با شخص ثالثی به اشتراک گذاشته نمی‌شود.