فهرست مطالب
Aleph Alpha Kolibri (یا Kolibri-1) مدل زبانی باز شرکت آلمانی Aleph Alpha است که روز ۳ اکتبر ۲۰۲۶ — همزمان با روز وحدت آلمان — منتشر شد. وزنهای کامل روی Hugging Face با لایسنس Apache 2.0 در دسترس است؛ تمرکز اصلیاش انگلیسی و آلمانی است و برای کارهای حساس سازمانی که «حاکمیت داده» و اجرای محلی مهم است طراحی شده، نه فقط برای چت عمومی. این مطلب یک بررسی نقش و مشخصات بر اساس اسناد رسمی شرکت است؛ امتیاز ستارهای ساختگی یا تست آزمایشگاه خودمان نیست.
جزئیات را از وبلاگ رسمی Aleph Alpha، کارت مدل روی Hugging Face و گزارش فنی شرکت میگیریم. اگر زمینهٔ ادغام و حاکمیت اروپایی این اکوسیستم برایتان مهم است، مطلب ادغام Cohere و Aleph Alpha را هم ببینید.
Kolibri چیست؟ پاسخ کوتاه
مدل زبانی Mixture-of-Experts (ترکیب متخصصها): حدود ۷۸٫۱ میلیارد پارامتر کل، ولی حدود ۳٫۴۶ میلیارد پارامتر فعال برای هر توکن.
دو زبانهٔ انگلیسی–آلمانی؛ نه یک مدل انگلیسی که فقط کمی آلمانی دیده باشد.
زمینه (context) تا حدود ۱ میلیون توکن؛ برای کارایی و کارهای پیچیده، شرکت معمولاً تا حدود ۲۶۲ هزار توکن را پیشنهاد میکند.
وزنها باز با Apache 2.0؛ برای سرو کردن به بستهٔ aleph-alpha-inference و افزونهٔ vLLM نیاز دارید.
هدف اعلامشده: کارهای مأموریتحساس در بخش عمومی، صنعت و هوافضا — با تأکید روی شفافیت زنجیرهٔ تأمین و استقرار کنترلشده.
سختافزار طبق کارت مدل: ردپای حافظه حدود ۷۸ گیگابایت (وزنهای FP8)؛ حداقل مثلاً دو A100 هشتاد گیگابایتی یا معادلهای قویتر.
دو اصطلاح مهم به زبان ساده
وزن باز (open-weight) یعنی فایلهای مدل را میتوانید دانلود کنید و روی زیرساخت خودتان اجرا کنید؛ برخلاف سرویسهای بستهای که فقط از طریق API شرکت به مدل دسترسی دارید. لایسنس Apache 2.0 اینجا یعنی آزادی نسبتاً وسیع برای استفاده و استقرار تجاری، با شروط همان لایسنس.
Mixture-of-Experts یا MoE یعنی داخل مدل چند «متخصص» وجود دارد و برای هر توکن فقط بخشی از آنها روشن میشود. نتیجهٔ عملی: ظرفیت دانش شبیه مدل بزرگتر، ولی هزینهٔ محاسبهٔ هر توکن نزدیک مدل کوچکتر میماند. بهایش حافظه است: باید تقریباً کل مدل را در GPU نگه دارید، حتی اگر فقط بخشی فعال باشد.
زمینه: Aleph Alpha و «حاکمیت» مدل
Aleph Alpha در هایدلبرگ آلمان شناخته میشود و سالها روی هوش مصنوعی سازمانی با زاویهٔ اروپایی کار کرده است. در معرفی Kolibri، شرکت میگوید مدل را در آلمان ساخته، روی زیرساخت آلمان و فنلاند آموزش داده، و زنجیرهٔ داده تا ارزیابی را تحت کنترل خودش نگه داشته است. برای مشتری دولتی یا صنعتی، این روایت یعنی کمتر وابسته بودن به ابر ارائهدهندهٔ خارجی و امکان استقرار on-premise بدون فرستادن دادهٔ داخلی به سرویس شخص ثالث.
قبل از Kolibri، تیم یک نسخهٔ داخلی به نام Kolibri Origin (حدود ۳۰٫۶ میلیارد پارامتر کل و حدود ۳٫۲۷ میلیارد فعال) ساخته بود که علناً منتشر نشد. طبق جدول خود شرکت، پیشآموزش Origin حدود ۱۱ ژوئن ۲۰۲۶ تمام شد و Kolibri حدود ۱۱ سپتامبر؛ فاصلهٔ کوتاه بین این دو، بخشی از داستان «Model Factory» آنهاست.
مشخصات فنی که واقعاً مهماند
معماری: ۵۰ لایه MoE؛ ۳۸۴ متخصص در هر لایه، ۶ متخصص مسیریابیشده بهعلاوهٔ یک متخصص مشترک؛ توجه ترکیبی پنجرهای و تمامزمینه.
آموزش: حدود ۲۰ تریلیون توکن پیشآموزش، بهعلاوهٔ mid-training و تطبیق زمینهٔ بلند؛ cutoff دانش اعلامشده برای EN/DE حدود ۱۸ ژوئن ۲۰۲۶.
استدلال قابل تنظیم: سطح تلاش reasoning روی none / low / medium / high تا هزینه و تأخیر را با کیفیت پاسخ عوض کنید.
ابزار و عامل: پشتیبانی tool calling در سروینگ اعلامشده با vLLM.
توکنایزر دو زبانه: واژگان ۱۲۸ هزار؛ شرکت ادعا میکند فشردهسازی آلمانی بهتری نسبت به بسیاری از مدلهای رایج دارد (ادعای شرکت).
پایهٔ زمینی و امتناع: آموزش برای گفتن «نمیدانم» وقتی شواهد در زمینه نیست (پروتکل Merlin-Arthur) — برای RAG سازمانی مهم است، ولی باید در استقرار خودتان هم اندازه بگیرید.
چطور اجرا میشود؟
طبق کارت Hugging Face و پست وبلاگ، فقط دانلود وزن کافی نیست؛ باید بستهٔ aleph-alpha-inference را نصب کنید (یا ایمیج کانتینر رسمی را بگیرید) تا افزونهٔ vLLM مدل کار کند. بعد مدل را با پارسریهای reasoning و tool-call مخصوص Kolibri سرو میکنید. برای زمینهٔ بلندتر از حدود ۲۶۲ هزار توکن، فلگهای max-model-len و override مربوط به موقعیت را طبق مستندات خود شرکت اضافه کنید.
پارامترهای نمونهگیری پیشنهادی شرکت: temperature حدود ۱٫۰، top_p حدود ۰٫۹۷، top_k حدود ۱۲۸. این اعداد توصیهٔ سازنده است، نه قانون طلایی برای هر کاربرد.
سختافزار: واقعبین باشید
کارت مدل صریح میگوید ردپای حافظه حدود ۷۸ گیگابایت برای وزنهای FP8 است. حداقل اعلامشده شامل مواردی مثل دو GPU از نوع A100 با ۸۰ گیگابایت، دو H100، یا یک H200 / B200 / B300 است؛ پیشنهاد عملیتر اغلب دو H100 یا قویتر است. یعنی Kolibri «مدل سبک لپتاپ» نیست؛ برای تیمهایی است که یا دیتاسنتر دارند یا بودجهٔ ابر GPU جدی. مزیت MoE این است که با فعال بودن حدود ۳٫۵ میلیارد پارامتر، توان عملیاتی به ازای هزینهٔ سروینگ میتواند بهتر از مدل متراکم همظرفیت باشد — باز هم به شرط داشتن حافظهٔ کافی برای کل وزنها.
بنچمارکها: با احتیاط بخوانید
Aleph Alpha جدولهای مفصلی منتشر کرده و Kolibri را در برابر مدلهایی مثل Qwen3.6-35B-A3B، Nemotron 3 Super و Mistral Small 4 گذاشته است. طبق اعداد خود شرکت، میانگین کلی انگلیسی حدود ۷۵٫۵ و آلمانی حدود ۷۰٫۸ گزارش شده و در ریاضی و کد در چند ردیف ادعای رقابت با مدلهایی با پارامتر فعال چند برابر بیشتر دیده میشود. اینها نتیجهٔ harness خود شرکت است؛ ارزیابی مستقل شخص ثالث عمومی در زمان نوشتن این مطلب مبنای ما نیست. برای تصمیم خرید/استقرار، بنچمارک داخلی شرکت را نقطهٔ شروع بگیرید، نه حکم قطعی کیفیت در دامنهٔ شما.
جدول مقایسهٔ نقش (بدون امتیاز جعلی)
این جدول نقش رایج را نشان میدهد، نه رتبهٔ زیبایی یا سرعت قطعی.
موضوع | Aleph Alpha Kolibri | Qwen3.6 / خانوادهٔ Qwen باز | Nemotron / Mistral Small باز |
|---|---|---|---|
نقطهٔ قوت رایج | انگلیسی–آلمانی عمیق؛ روایت حاکمیت EU/آلمان؛ استقرار کنترلشده | پوشش گستردهٔ زبانها و اکوسیستم بزرگ جامعه | گزینههای قوی عمومی برای عامل، کد و سروینگ رایج |
وزن و لایسنس | باز، Apache 2.0؛ نیاز به استک سروینگ اختصاصی Aleph | معمولاً باز با لایسنسهای خانوادهٔ Qwen | باز با شرایط NVIDIA / Mistral؛ استکهای رایجتر جامعه |
فعال به ازای توکن | حدود ۳٫۵B از حدود ۷۸B کل (MoE) | مثلاً حدود ۳B فعال در برخی نسخههای ۳۵B-A3B | فعال بالاتر در برخی نسخههای بزرگتر Super / Small |
مناسبتر برای | ادارهٔ عمومی آلمانی، صنعت/هوافضای تحت مقررات، RAG سازمانی DE/EN | تیمهایی که تنوع زبان و ابزار جامعه میخواهند | پایپلاینهای عامل/کد با ابزار رایج و بنچمارک عمومی |
ریسک عملی | سختافزار سنگین؛ وابستگی به پلاگین inference شرکت؛ بنچمارک عمدتاً خوداظهاری | عمق آلمانی و انطباق حاکمیتی ممکن است اولویت کمتری داشته باشد | تمرکز دو زبانهٔ DE/EN و روایت حاکمیت اروپایی ضعیفتر |
قوتها و ضعفهای عملی
قوت: وزن باز واقعی با لایسنس آشنا برای حقوقیهای سازمانی.
قوت: طراحی دو زبانهٔ EN/DE و تأکید روی دادهٔ آلمانی اصیل (نه فقط ترجمه).
قوت: زمینهٔ خیلی بلند و کنترل سطح استدلال برای تنظیم هزینه.
قوت: تمرکز اعلامشده روی grounding و امتناع از پاسخ بیپایه — برای اسناد داخلی حیاتی است.
ضعف: حداقل سختافزار جدی؛ برای استارتاپ بدون GPU سازمانی سخت است.
ضعف: سروینگ خارج از مسیر استاندارد «فقط vLLM معمولی»؛ باید استک Aleph را راه بیندازید.
ضعف: بنچمارکهای درخشان عمدتاً از خود شرکتاند؛ تا ارزیابی مستقل دامنهای، با احتیاط برنامهریزی کنید.
ضعف: تخصص اعلامشده روی عمودیهای خاص است؛ برای زبانهای غیر EN/DE گزینهٔ اصلی نیست.
برای چه کسی مناسب است؟
مناسبتر: سازمانهای آلمانی/اروپایی (یا تیمهای دو زبانه EN/DE) که باید مدل را داخل مرز خودشان نگه دارند، سند و RAG حقوقی/اداری دارند، و بودجهٔ GPU واقعی دارند. همچنین تیمهایی که لایسنس باز و قابلیت ممیزی زنجیره برایشان از «قویترین مدل ابری روز» مهمتر است.
مناسبتر نیست (فعلاً): کاربر نهایی بدون سرور، تیمهایی که فقط API ابری میخواهند، یا پروژههایی با زبانهای زیاد غیر از انگلیسی و آلمانی. اگر فقط یک چتبات سبک میخواهید، مدلهای کوچکتر یا سرویسهای میزبانشده معمولاً مسیر سریعتریاند.
سؤالات پرتکرار
Kolibri همان Kolibri Origin است؟
خیر. Origin نسخهٔ داخلی کوچکتر (حدود ۳۰B کل) بود و علناً منتشر نشد. Kolibri-1 مدل عمومی اکتبر ۲۰۲۶ با حدود ۷۸B کل و زمینهٔ بسیار بلندتر است.
آیا کاملاً رایگان است؟
وزنها با Apache 2.0 در دسترساند؛ یعنی هزینهٔ لایسنس مدل بهمعنای بسته بودن وزن نیست. هزینهٔ واقعی شما سختافزار، برق، مهندسی سروینگ و پشتیبانی است — نه «قیمت ماهانهٔ مدل» بهسبک SaaS.
روی یک GPU خانگی اجرا میشود؟
طبق حداقلهای کارت مدل، معمولاً خیر. حدود ۷۸ گیگابایت فقط برای وزنهای FP8 نیاز است؛ مسیر رسمی حداقلهایی در حد دو A100 هشتاد گیگابایتی یا معادل قویتر را میگوید.
چرا به aleph-alpha-inference نیاز است؟
چون معماری و پارسرهای reasoning/tool-call مدل با استک اختصاصی شرکت یکپارچه شدهاند. بدون آن افزونه، سروینگ استاندارد vLLM بهتنهایی کافی اعلام نشده است.
آیا از مدلهای چینی یا آمریکایی باز بهتر است؟
بستگی به معیار دارد. در جدولهای خود Aleph Alpha، Kolibri در چند بنچمارک EN/DE با فعالپارامتر کم رقابت میکند؛ اما این مقایسهٔ شرکت است. برای دامنهٔ آلمانیِ مقرراتی ممکن است انتخاب منطقیتری باشد؛ برای چندزبانهٔ جهانی یا اکوسیستم ابزار گستردهتر، گزینههای دیگر هنوز جدیاند.
زمینهٔ ۱ میلیون توکن یعنی چه در عمل؟
یعنی از نظر معماری میتوانید سندهای بسیار بلند را در یک درخواست جا بدهید. خود شرکت برای کارایی و کارهای پیچیده توصیه میکند معمولاً تا حدود ۲۶۲ هزار توکن بمانید؛ زمینهٔ خیلی بلند همیشه بهمعنای کیفیت پایدار و ارزان نیست.
برای RAG سازمانی آلمانی مناسب است؟
طراحی اعلامشده دقیقاً همین مسیر را هدف گرفته: grounding، امتناع، و ارزیابیهای عمودی مثل بخش عمومی آلمان. با این حال قبل از production، روی اسناد واقعی خودتان و با گاردهای لایهٔ اپلیکیشن تست کنید.
جمعبندی
Kolibri یک مدل باز جدی از اکوسیستم اروپایی است: MoE با حدود ۷۸ میلیارد پارامتر کل و حدود ۳٫۵ میلیارد فعال، دو زبانهٔ انگلیسی–آلمانی، لایسنس Apache 2.0، و تمرکز روشن روی حاکمیت و استقرار کنترلشده. اگر تیمتان GPU سازمانی دارد و داستان انطباق/on-premise برایتان حیاتی است، ارزش ارزیابی عملی دارد. اگر دنبال چت رایگان روی لپتاپ یا بهترین امتیاز عمومی جهان بدون قید سختافزار هستید، این محصول آن مسیر نیست. بنچمارکهای شرکت را جدی بگیرید ولی مطلق نکنید؛ معیار نهایی، کیفیت روی دادهها و گردشکار خود شماست.



