فهرست مطالب
Ollama (اُلاما بخوانش) یک برنامهٔ رایگان و اوپنسورس است که مدلهای هوش مصنوعی را روی کامپیوتر خودت اجرا میکند — بدون اینترنت، بدون اشتراک ماهانه و بدون اینکه حتی یک کلمه از حرفهایت به سرور هیچ شرکتی برود. در این آموزش از صفر مطلق شروع میکنیم: نصب روی ویندوز، مک و لینوکس، دانلود اولین مدل، اولین گفتگو، حرف زدن فارسی با مدل، ساخت دستیار شخصی خودت و حتی صدا زدن مدل از طریق API. آخر این مطلب، یک موتور هوش مصنوعی کامل روی دستگاه خودت داری که هر وقت خواستی، حتی وسط بیابان بدون اینترنت، جوابت را میدهد.
این آموزش قدمبهقدم است و هیچ مرحلهای را رد نکردهام. هر قدم سه بخش دارد: هدف (چرا این کار را میکنیم)، اقدام دقیق (کلیکبهکلیک یا دستوربهدستور) و نتیجهای که باید ببینی (اگر این را ندیدی، یعنی جایی اشتباه رفتهای). آخر هر مرحله هم خطای رایجش را گفتهام تا گیر نکنی. برویم.
پاسخ کوتاه
Ollama یعنی برنامهای که دانلود و اجرای مدلهای زبانی بزرگ (LLM) را به سه دستور ساده تبدیل میکند: دانلود، اجرا، گفتگو.
کاملاً رایگان و اوپنسورس است و برای نصب و استفاده به حساب کاربری، ایمیل یا کارت بانکی نیاز نداری.
برای شروع، مدل qwen2.5:7b را پیشنهاد میکنم: ۴.۷ گیگابایت حجم دانلود دارد، فارسی را خوب میفهمد و روی هر سیستمی با ۸ گیگ رم روان اجرا میشود.
بعد از دانلود مدل، دیگر به اینترنت نیاز نداری؛ همهچیز روی دستگاه خودت و روی آدرس محلی localhost:11434 اجرا میشود.
اگر برنامهنویسی، مدل را میتوانی از طریق API محلی هم صدا بزنی و در پروژههای خودت استفاده کنی.
اول زمینه: «اجرای لوکال» یعنی چه؟
قبل از اینکه دست به نصب بزنی، سه دقیقه صبر کن. اگر این سه مفهوم را بفهمی، بقیهٔ آموزش مثل آب خوردن جلو میرود؛ اگر هم میدانیشان، رد شو و برو سراغ «پیشنیازها».
مدل زبانی بزرگ (LLM) یعنی چه؟
مدل زبانی بزرگ یعنی یک برنامهٔ هوشمند که با خواندن میلیاردها صفحه متن یاد گرفته مثل انسان بنویسد و حرف بزند. وقتی به ChatGPT یا Claude پیام میدهی، داری با یکی از همین مدلها حرف میزنی — فقط آن مدل روی سرورهای آن شرکتها نشسته و تو از راه دور بهش وصل میشوی. ایدهٔ این آموزش برعکس است: همانجور مدلی را دانلود میکنیم و روی کامپیوتر خودت اجرا میکنیم. به این کار میگویند «اجرای لوکال» (local، یعنی محلی) — محلی یعنی همینجا، روی دستگاه تو، نه روی سرور کسی دیگر.
Ollama چیست؟
تا همین یکی دو سال پیش، اجرای مدل روی کامپیوتر خودت یک پروژهٔ فنیِ دردسرساز بود: باید پایتون نصب میکردی، کتابخانهها را با هم سازگار میکردی، با خطاهای عجیبوغریب دستوپنجه نرم میکردی. Ollama همهٔ آن دردسر را جمع کرده و تبدیلش کرده به یک برنامهٔ معمولی که نصب میکنی و بعد با سه دستور ساده مدل دانلود و اجرا میکنی. پشت صحنه کارهای فنی (مثل شتابدهی با کارت گرافیک) را خودش انجام میدهد و یک API استاندارد هم در اختیارت میگذارد تا برنامههای دیگر — از افزونهٔ مرورگر تا کد خودت — بتوانند به مدل وصل شوند.
چرا اصلاً مدل را لوکال اجرا کنیم؟ سه دلیل محکم
یک — حریم خصوصی واقعی. وقتی با مدل لوکال حرف میزنی، هیچ دادهای از کامپیوترت بیرون نمیرود. اگر میخواهی متن قرارداد کاریات را خلاصه کنی یا دربارهٔ یک موضوع حساس سؤال بپرسی، خیالت راحت است که هیچ سروری آن را نمیبیند و ذخیره نمیکند.
دو — کار بدون اینترنت. مدل یکبار دانلود میشود و بعد برای همیشه روی دستگاه توست. توی هواپیما، توی جاده، هرجا که اینترنت نداری یا اینترنتت کند است، دستیار هوش مصنوعیات همراهت است.
سه — رایگان و بدون سقف. سرویسهای ابری معمولاً محدودیت روزانه دارند یا پول میگیرند. مدل لوکال را هرچقدر بخواهی صدا بزن؛ نه کسی صورتحساب میفرستد، نه وسط یک پروژهٔ مهم به سقف مصرف میخوری.
راستش را هم بگویم: مدلهای لوکال امروزی در کارهای روزمره — نوشتن، ترجمه، خلاصهسازی، ایدهپردازی — بهطرز شگفتانگیزی خوب شدهاند. البته در استدلالهای خیلی پیچیده هنوز به پای بزرگترین مدلهای ابری نمیرسند؛ ولی برای ۹۰ درصد کارهای روزانه همان چیزیاند که لازم داری.
پیشنیازها
قبل از شروع، این چکلیست را تیک بزن. اگر همه تیک خورد، تا آخر آموزش گیر نمیکنی:
سیستمعامل: ویندوز ۱۰ به بالا، مک (macOS Big Sur نسخهٔ ۱۱ به بالا) یا لینوکس (مثل اوبونتو ۱۸.۰۴ به بالا). روی هر سه، Ollama نسخهٔ رسمی دارد.
رم: دستکم ۸ گیگابایت برای مدلهای ۷ میلیارد پارامتری. قانون سرانگشتی دنیای مدلهای لوکال این است: بهازای هر ۱ میلیارد پارامتر، حدود ۱ گیگابایت حافظه لازم داری. یعنی مدل ۷ میلیاردی ≈ ۷ گیگ + کمی حافظه برای خود سیستم = ۸ گیگ. اگر ۱۶ گیگ رم داری، مدلهای ۱۳ میلیاردی هم برایت باز است.
فضای دیسک: هر مدل چند گیگابایت جا میگیرد (مدل پیشنهادی ما ۴.۷ گیگ). کمی فضای خالی نگه دار.
اینترنت: فقط برای دانلود اولیهٔ مدل لازم است. بعدش میتوانی کابل را بکشی و آفلاین کار کنی.
کارت گرافیک: لازم نیست! بدون GPU هم مدل اجرا میشود، فقط کمی کندتر. اگر کارت گرافیک انویدیا یا AMD داری، Ollama خودش از آن استفاده میکند و سرعت چند برابر میشود.
حساب کاربری: لازم نیست. نه ایمیل، نه ثبتنام، نه کارت بانکی.
کدام مدل را دانلود کنی؟
کتابخانهٔ Ollama صدها مدل دارد و انتخاب اول میتواند گیجکننده باشد. جدول زیر را از روی صفحهٔ رسمی کتابخانهٔ مدلهای Ollama برداشتهام تا با عدد واقعی تصمیم بگیری:
مدل | حجم دانلود | رم لازم | به درد کی میخورد؟ |
|---|---|---|---|
qwen2.5:7b | ۴.۷ گیگابایت | ۸ گیگ | پیشنهاد اول من: چندزبانه (۲۹+ زبان)، فارسی را خوب میفهمد، کانتکست ۳۲ هزار توکنی |
gemma3:4b | چند گیگابایت | ۸ گیگ | ساخت گوگل، ۱۴۰+ زبان، عکس هم میفهمد (مالتیمودال) |
qwen2.5:1.5b | ۹۸۶ مگابایت | ۴ گیگ | سیستم ضعیف یا تست سریع؛ کیفیت پایینتر از ۷ میلیاردی |
qwen2.5:14b | ۹.۰ گیگابایت | ۱۶ گیگ | اگر ۱۶ گیگ رم داری و جوابهای دقیقتر میخواهی |
نتیجهٔ جدول: اگر رمات ۸ گیگ است، سراغ qwen2.5:7b برو — همان که در ادامهٔ آموزش با آن کار میکنیم. کانتکست ۳۲ هزار توکنیاش یعنی میتواند متنی بهبلندای حدود ۲۴ هزار کلمهٔ انگلیسی را یکجا بخواند؛ برای خلاصهسازی یک مقالهٔ بلند یا یک فصل کتاب کافی است.
یک نکتهٔ مهم دربارهٔ فارسی: همهٔ مدلها فارسی را یکسان بلد نیستند. مدلهایی مثل qwen2.5 و gemma3 که رسماً چندزبانه طراحی شدهاند، فارسی را روان میفهمند و جواب میدهند؛ بعضی مدلهای دیگر (مثل خانوادهٔ Llama که تمرکزش روی چند زبان خاص است) در فارسی ضعیفترند. پس برای کار فارسی، همان دو پیشنهاد جدول را جدی بگیر.
مرحلهٔ ۱ — دانلود و نصب Ollama
هدف: برنامهٔ Ollama را روی سیستمعامل خودت نصب کنی تا بهصورت سرویس پسزمینه اجرا شود.
اقدام دقیق: بر اساس سیستمعاملت یکی از این سه راه را برو:
مک: فایل نصب را از صفحهٔ ollama.com/download بگیر و مثل هر برنامهٔ مکی نصبش کن. اگر Homebrew داری، راه سریعتر این است که در ترمینال بنویسی: brew install ollama
ویندوز: در منوی استارت تایپ کن PowerShell، بازش کن و این دستور را بچسبان و اینتر بزن: irm https://ollama.com/install.ps1 | iex — یا فایل OllamaSetup.exe را از همان صفحهٔ دانلود بگیر و نصب کن.
لینوکس: ترمینال را باز کن و این دستور را بزن: curl -fsSL https://ollama.com/install.sh | sh
نتیجهای که باید ببینی: بعد از نصب، آیکون Ollama (یک لامای سفید) در نوار منو یا سینی سیستم ظاهر میشود و برنامه در پسزمینه اجرا میشود. روی لینوکس، نصبکننده معمولاً Ollama را بهعنوان سرویس systemd ثبت میکند تا با هر بار روشن شدن سیستم خودش بالا بیاید.
خطای رایج: روی بعضی نسخههای لینوکس، نصبکننده وسط کار با خطای «نیاز به zstd» متوقف میشود. راهحلش ساده است: اول با sudo apt-get install zstd (اوبونتو/دبیان) آن ابزار فشردهسازی را نصب کن و بعد دستور نصب Ollama را دوباره بزن. من خودم دقیقاً همین خطا را در تست این آموزش گرفتم و با همین راه حل شد.

خروجی واقعی نصب Ollama با اسکریپت رسمی؛ آخرش نسخهٔ نصبشده را هم میبینی
مرحلهٔ ۲ — مطمئن شو نصب درست انجام شده
هدف: قبل از دانلود چند گیگابایتی مدل، مطمئن شوی Ollama سالم نصب شده و سرویسش بالاست.
اقدام دقیق: ترمینال (یا PowerShell در ویندوز) را باز کن و بنویس: ollama --version و اینتر بزن.
نتیجهای که باید ببینی: یک خط مثل ollama version is 0.40.2 (شمارهٔ نسخه در سیستم تو ممکن است جدیدتر باشد). دیدن شمارهٔ نسخه یعنی Ollama نصب شده و آمادهٔ کار است. اگر بهجایش خطای «command not found» دیدی، یعنی نصب ناقص بوده یا ترمینال را باید ببندی و دوباره باز کنی تا مسیر برنامه به سیستم اضافه شود.

اگر شمارهٔ نسخه را دیدی، یعنی Ollama سالم نصب شده و آمادهٔ کار است
مرحلهٔ ۳ — دانلود اولین مدل
هدف: مدل qwen2.5 با ۷ میلیارد پارامتر را از کتابخانهٔ رسمی Ollama دانلود کنی.
اقدام دقیق: در همان ترمینال بنویس: ollama pull qwen2.5:7b و اینتر بزن. دانلود شروع میشود و درصد پیشرفت را زنده میبینی.
نتیجهای که باید ببینی: بعد از رسیدن به ۱۰۰٪، پیام success چاپ میشود. حجم دانلود ۴.۷ گیگابایت است؛ با اینترنت معمولی خانگی بین چند دقیقه تا حدود نیم ساعت طول میکشد. صبور باش — این بزرگترین دانلود کل آموزش است و فقط یکبار انجام میشود.
خطای رایج: اگر دانلود نصفه قطع شد (اینترنت رفت یا لپتاپ خوابید)، نگران نباش: همان دستور ollama pull qwen2.5:7b را دوباره بزن؛ Ollama از همانجایی که مانده ادامه میدهد و از اول شروع نمیکند.

خروجی واقعی ollama list بعد از دانلود مدل؛ ستون SIZE حجم هر مدل را نشان میدهد
مرحلهٔ ۴ — اولین گفتگویت با مدل
هدف: مدل را اجرا کنی و اولین پیامت را بفرستی — لحظهای که هوش مصنوعی روی کامپیوتر خودت جان میگیرد.
اقدام دقیق: در ترمینال بنویس: ollama run qwen2.5:7b و اینتر بزن. چند ثانیه صبر کن تا مدل در حافظه بارگذاری شود؛ بعد یک پرامپت >>> میبینی. حالا هرچه میخواهی بنویس، مثلاً: «سلام! خودت را معرفی کن.»
نتیجهای که باید ببینی: مدل شروع میکند به نوشتن جواب، کلمهبهکلمه، درست جلوی چشمانت — بدون اینکه حتی یک بایت به اینترنت برود. تبریک میگویم؛ داری با یک هوش مصنوعیِ کاملاً شخصی حرف میزنی.
دستورات داخل گفتگو: وقتی داخل چت هستی، چند دستور مخفی داری که با اسلش شروع میشوند. مهمترینشان:
/bye — خروج از گفتگو و برگشت به ترمینال
/? — نمایش همهٔ دستورات موجود
/show info — دیدن مشخصات مدلی که داری باهاش حرف میزنی
خطای رایج: اگر بعد از ollama run خطای اتصال دیدی، یعنی سرویس Ollama بالا نیست. روی لینوکس با ollama serve در یک ترمینال جداگانه اجرایش کن؛ روی ویندوز و مک معمولاً با باز کردن برنامهٔ Ollama مشکل حل میشود.

اولین گفتگوی واقعی با مدل در ترمینال — همینقدر ساده شروع میشود
مرحلهٔ ۵ — مدلهایت را مدیریت کن
هدف: یاد بگیری مدلها را ببینی، جزئیاتشان را چک کنی و آنهایی را که لازم نداری پاک کنی تا دیسکت پر نشود.
اقدام دقیق: این چهار دستور، جعبهابزار مدیریتی تو هستند:
دستور | یعنی چه؟ | کی به کارت میآید؟ |
|---|---|---|
ollama list | فهرست مدلهای دانلودشده با حجم و تاریخ | وقتی میخواهی ببینی چه مدلهایی داری |
ollama ps | مدلهایی که الان در حافظهاند | وقتی حس میکنی سیستم کند شده و میخواهی ببینی چه چیزی رم را گرفته |
ollama show qwen2.5:7b | مشخصات کامل یک مدل | قبل از دانلود مدل تازه، برای چک کردن حجم و قابلیتها |
ollama rm qwen2.5:7b | حذف کامل یک مدل از دیسک | وقتی مدلی را دیگر نمیخواهی و فضا لازم داری |
نتیجهای که باید ببینی: خروجی ollama list باید مدل qwen2.5:7b را با حجم حدود ۴.۷ گیگابایت نشان بدهد. اگر خواستی مدلی را امتحان کنی و بعد پاکش کنی، هیچ هزینهای ندارد — هر وقت خواستی با یک pull دوباره برش میگردانی.
مرحلهٔ ۶ — فارسی حرف بزن
هدف: مطمئن شوی مدل فارسی را درست میفهمد و روان جواب میدهد — چون قرار است دستیار فارسیزبان تو باشد.
اقدام دقیق: دوباره ollama run qwen2.5:7b را بزن و این بار فارسی بنویس. مثلاً بپرس: «پایتخت فرانسه کجاست و سه جای دیدنیاش را نام ببر.»
نتیجهای که باید ببینی: مدلهای چندزبانهای مثل qwen2.5:7b و gemma3:4b فارسی را روان میفهمند و جواب میدهند — طبق صفحهٔ رسمی کتابخانهٔ Ollama، اولی از ۲۹+ زبان و دومی از ۱۴۰+ زبان پشتیبانی میکند. اگر جایی جوابش انگلیسی شد، بنویس «به فارسی جواب بده»؛ مدلها معمولاً به زبانِ پیام تو جواب میدهند.
یک هشدار صادقانه: موقع آمادهسازی این آموزش، نسخهٔ سبک نیممیلیاردی (qwen2.5:0.5b) را هم تست کردم — فارسی را بههمریخته و نامفهوم تحویل داد. درسش روشن است: مدلهای خیلی کوچک برای تست سرعتاند، نه برای کار جدی فارسی. اگر فارسیِ تمیز میخواهی، همان ۷ میلیاردی را دانلود کن.
نکتهٔ کاربردی: برای کارهای فارسی جدی، اول پیامت بنویس «به فارسیِ روان جواب بده.» همین یک جمله کیفیت خروجی را محسوس بالا میبرد.
مرحلهٔ ۷ — دستیار فارسی خودت را بساز
هدف: یک مدل شخصی بسازی که همیشه فارسی جواب بدهد و شخصیت دلخواه تو را داشته باشد — مثلاً یک معلم صبور یا یک ویراستار سختگیر.
اقدام دقیق: این قابلیت اسمش Modelfile است (یعنی «فایلِ تعریفِ مدل» — یک فایل متنی ساده که به Ollama میگوید مدلت چه شخصیتی داشته باشد):
۱. یک پوشهٔ تازه بساز و داخلش یک فایل متنی به اسم Modelfile (بدون پسوند) درست کن.
۲. این سه خط را داخلش بنویس و ذخیره کن:
FROM qwen2.5:7b PARAMETER temperature 0.7 SYSTEM "You are a helpful assistant. Always answer in fluent Persian."
۳. در ترمینال، برو به همان پوشه و بنویس: ollama create دستیار-فارسی -f Modelfile
۴. حالا اجرایش کن: ollama run دستیار-فارسی
نتیجهای که باید ببینی: بعد از دستور create، پیام success میبینی و مدلت با اسم «دستیار-فارسی» در فهرست ollama list ظاهر میشود. از این به بعد هر وقت اجرایش کنی، بدون اینکه چیزی بگویی فارسی جواب میدهد. خط SYSTEM همان «دستور پنهان» است که همیشه همراه مدل میماند؛ میتوانی آن را عوض کنی — مثلاً بنویسی «تو یک معلم ریاضی صبوری که با مثال ساده توضیح میدهی» — و با ollama create یک شخصیت تازه بسازی.
خطای رایج: اگر create خطا داد، اول چک کن که فایل دقیقاً Modelfile نام دارد (نه Modelfile.txt — ویندوز گاهی خودش پسوند txt میچسباند) و دستور را از داخل همان پوشه اجرا کردهای.

خروجی واقعی ساخت مدل سفارشی؛ بعد از success مدل تو در فهرست ollama list میآید
مرحلهٔ ۸ — مدل را با API صدا بزن (برای برنامهنویسها)
هدف: اگر کد مینویسی، یاد بگیری از داخل برنامهات به مدل لوکال درخواست بفرستی — بدون کلید API و بدون هزینه.
اقدام دقیق: Ollama یک وبسرور محلی روی آدرس http://localhost:11434 بالا میآورد. در یک ترمینال تازه این دستور را بزن (مدل qwen2.5:7b باید از قبل pull شده باشد):
curl http://localhost:11434/api/generate -d '{"model": "qwen2.5:7b", "prompt": "What is 2+2? Answer with just the number.", "stream": false}'
نتیجهای که باید ببینی: یک متن JSON برمیگردد که داخل فیلد response آن، جواب مدل است — در این مثال فقط عدد «۴». همین! حالا میتوانی همین درخواست را از پایتون، جاوااسکریپت یا هر زبانی بفرستی و مدل لوکال را قلبِ اپلیکیشن خودت کنی. مستندات کامل این API در مستندات رسمی Ollama هست.
نکتهٔ کاربردی: با متغیر محیطی OLLAMA_HOST=0.0.0.0 مدل روی کل شبکهٔ خانگیات در دسترس است — ولی این کار را روی اینترنت عمومی نکن؛ مدل لوکالت رمز ندارد.

خروجی واقعی API محلی؛ فیلد response همان جواب مدل است
مرحلهٔ ۹ — یک رابط گرافیکی قشنگ برایش بگذار
هدف: اگر حوصلهٔ ترمینال را نداری، یک صفحهٔ چتِ شیک مثل ChatGPT برای مدل لوکالت داشته باشی.
اقدام دقیق — راه ساده (پیشنهاد من): افزونهٔ Page Assist را از فروشگاه افزونههای کروم نصب کن. بعد از نصب، در تنظیماتش آدرس Ollama را http://localhost:11434 بگذار — افزونه خودش مدلهای دانلودشدهات را پیدا میکند و یک صفحهٔ چت تمیز باز میکند. بدون داکر، بدون دردسر.
اقدام دقیق — راه حرفهای: اگر داکر داری و یک رابط کامل با تاریخچهٔ گفتگوها، آپلود فایل و چندکاربره میخواهی، Open WebUI را نصب کن:
docker run -d -p 3000:8080 -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main
بعد در مرورگر برو به http://localhost:3000 و در تنظیمات، اتصال Ollama را فعال کن.
نتیجهای که باید ببینی: یک صفحهٔ چت در مرورگر که مدلهای لوکالت را فهرست میکند — با این تفاوت که همهچیز روی دستگاه خودت است.
عیبیابی: اگر جایی گیر کردی
اگر جایی گیر کردی، راهحلش اینجاست:
دانلود مدل نصفه ماند یا خطای شبکه داد ← همان ollama pull qwen2.5:7b را دوباره بزن؛ دانلود از همانجا ادامه پیدا میکند.
خطای «could not connect» یا «connection refused» ← سرویس Ollama بالا نیست. روی لینوکس در یک ترمینال جدا ollama serve را اجرا کن؛ روی ویندوز و مک برنامهٔ Ollama را باز کن و چند ثانیه صبر کن.
مدل خیلی کند جواب میدهد (کلمهبهکلمه با مکث طولانی) ← سه مظنون داری: مدلی بزرگتر از توان رمات انتخاب کردهای (برو سراغ qwen2.5:1.5b)، برنامههای سنگین دیگری رم را گرفتهاند (ببندشان)، یا روی CPU اجرا میشود که ذاتاً کندتر است ولی طبیعی است.
روی لینوکس، نصب با خطای zstd متوقف شد ← اول sudo apt-get install zstd را بزن و بعد نصب Ollama را تکرار کن. (این دقیقاً همان خطایی است که من موقع تست این آموزش دیدم.)
پورت ۱۱۴۳۴ اشغال است ← یعنی یک نسخهٔ دیگر از Ollama (یا برنامهٔ دیگری) در حال اجراست. نسخهٔ اضافی را ببند و دوباره تلاش کن.
کارت گرافیک شناسایی نشد و همهچیز روی CPU است ← درایور گرافیکت را بهروز کن (انویدیا: درایور CUDA؛ لینوکس AMD: نسخهٔ جدید ROCm) و سیستم را ریاستارت کن. حتی بدون GPU هم کارت راه میافتد، فقط کندتر.
نکتههای پیشرفته (اختیاری ولی خوشمزه)
کوانتیزیشن یعنی چه؟ مدلها نسخهٔ «فشردهشده»اند (معمولاً Q4)؛ همین فشردهسازی مدل ۷ میلیاردی را از حدود ۱۴ گیگ به ۴.۷ گیگ میرساند با افت کیفیت ناچیز.
مدل را گرم نگه دار: بهصورت پیشفرض Ollama بعد از چند دقیقه بیکاری مدل را از حافظه خالی میکند تا رم آزاد شود؛ اجرای بعدی چند ثانیه طول میکشد تا مدل دوباره بارگذاری شود. این رفتار طبیعی است، نه خطا.
دما (temperature) را تنظیم کن: در Modelfile دیدی که temperature 0.7 گذاشتیم. دما یعنی میزان خلاقیت مدل: نزدیک صفر یعنی جوابهای خشک و دقیق (خوب برای کدنویسی)، نزدیک یک یعنی جوابهای خلاقانه و متنوع (خوب برای داستاننویسی).
کتابخانه را بگرد: در ollama.com/library صدها مدل هست — از مدلهای کدنویسی مثل qwen2.5-coder تا مدلهای استدلالی. هر کدام را که خواستی با همان ollama pull امتحان کن؛ امتحان کردن رایگان است.
یک نکته برای تو که از ایران وصل میشوی
Ollama هیچ حساب کاربری نمیخواهد؛ پس ماجرای تحریمِ حساب پیش نمیآید — همهچیز روی دستگاه خودت است. تنها دانلود اولیهٔ مدل به اینترنت نیاز دارد؛ اگر قطع شد، اتصال را بررسی کن و با همان pull ادامه بده. فایل نصب را فقط از سایت رسمی ollama.com بگیر، نه از سایتهای متفرقه.
جمعبندی
ببین چه راهی آمدی: Ollama را نصب کردی، سالم بودنش را تست کردی، یک مدل ۷ میلیارد پارامتری واقعی دانلود کردی، باهاش فارسی حرف زدی، دستیار شخصی خودت را با Modelfile ساختی و یاد گرفتی از طریق API صدایش بزنی. از این به بعد یک هوش مصنوعی داری که نه اشتراک میخواهد، نه اینترنت، نه اجازهٔ کسی — فقط کامپیوتر خودت و کمی کنجکاوی.
قدمهای بعدی اگر هوس کردی عمیقتر بروی: مدلهای کدنویسی کتابخانه را امتحان کن و ببین چطور در ساخت خروجیهای تعاملی کمکت میکنند؛ اگر دوست داری قابلیتهای دستیارهای ابری را هم بشناسی، آموزش حافظهٔ ChatGPT و آموزش دیپ ریسرچ را بخوان تا بفهمی کدام کار را به مدل لوکالت بسپاری و کدام را به ابر؛ و برای ایدههای خلاقانهٔ تصویری، آموزش کانوس گوگل هم منتظر توست.
پرسشهای متداول
آیا Ollama واقعاً رایگان است؟ پس مدلها از کجا میآیند؟
بله، خود Ollama رایگان و اوپنسورس است. مدلها را شرکتها و جوامع متنباز (مثل علیبابا برای Qwen و گوگل برای Gemma) با مجوز باز منتشر کردهاند و Ollama فقط آنها را بستهبندی و توزیع میکند. نه اشتراکی هست، نه سقف مصرفی، نه تبلیغاتی.
آیا بدون اینترنت هم کار میکند؟
بعد از اینکه مدل را یکبار دانلود کردی، بله — کاملاً آفلاین. فقط دانلود اولیهٔ مدل و بهروزرسانیها به اینترنت نیاز دارند.
فرق مدل لوکال با ChatGPT چیست؟
ChatGPT روی سرورهای OpenAI اجرا میشود؛ قویتر ولی با محدودیت مصرف و ارسال داده به سرور آنها. مدل لوکال خصوصی، رایگان و نامحدود است ولی در استدلالهای خیلی پیچیده یک پله پایینتر. خیلیها هر دو را دارند: کار حساس لوکال، کار سنگین ابری.
میشود روی گوشی هم اجرا کرد؟
خود Ollama رسماً فقط برای ویندوز، مک و لینوکس است. ولی ترفند رایج این است: Ollama را روی کامپیوتر خانه اجرا کنی و از طریق شبکهٔ خانگی (با همان تنظیم OLLAMA_HOST که گفتیم) از گوشی بهش وصل شوی.
مدلها فارسی را خوب بلدند؟
مدلهای چندزبانهای مثل qwen2.5 و gemma3 فارسی را روان میفهمند و جواب میدهند. ولی یک هشدار صادقانه: در همهٔ مدلها گاهی جواب فارسی کمی «ترجمهای» از آب درمیآید؛ با همان جملهٔ راهنمای «به فارسیِ روان جواب بده» کیفیت خیلی بهتر میشود.
دیسم پر شد؛ چطور مدلهای اضافی را پاک کنم؟
با ollama list ببین چه داری و با ollama rm نام-مدل آنهایی را که نمیخواهی حذف کن. هر وقت پشیمان شدی، با یک pull برمیگردند.
آیا حرفهایم جایی ذخیره یا ارسال میشود؟
نه. مدل روی دستگاه خودت اجرا میشود و گفتگوها از کامپیوترت بیرون نمیروند — مگر اینکه خودت از رابطهایی مثل Open WebUI استفاده کنی که تاریخچه را (باز هم روی دستگاه خودت) نگه میدارند.
منابع
سایت رسمی و صفحهٔ دانلود Ollama: ollama.com/download
کتابخانهٔ مدلها (حجم و مشخصات qwen2.5 و gemma3): ollama.com/library
مستندات رسمی (نصب، Modelfile، API): docs.ollama.com
مخزن متنباز Ollama در گیتهاب: github.com/ollama/ollama
مستندات Open WebUI: docs.openwebui.com



