پرش به محتوای اصلی
آموزش و راهنما

اجرای هوش مصنوعی روی کامپیوتر: آموزش کامل Ollama از صفر

Ollama را قدم‌به‌قدم نصب کن: دانلود مدل qwen2.5، اولین گفتگو، حرف زدن فارسی، ساخت دستیار شخصی با Modelfile و API محلی — همه آفلاین و رایگان روی کامپیوتر خودت.

۲۰ دقیقه مطالعه
اشتراک‌گذاری:
فهرست مطالب

Ollama (اُلاما بخوانش) یک برنامهٔ رایگان و اوپن‌سورس است که مدل‌های هوش مصنوعی را روی کامپیوتر خودت اجرا می‌کند — بدون اینترنت، بدون اشتراک ماهانه و بدون اینکه حتی یک کلمه از حرف‌هایت به سرور هیچ شرکتی برود. در این آموزش از صفر مطلق شروع می‌کنیم: نصب روی ویندوز، مک و لینوکس، دانلود اولین مدل، اولین گفتگو، حرف زدن فارسی با مدل، ساخت دستیار شخصی خودت و حتی صدا زدن مدل از طریق API. آخر این مطلب، یک موتور هوش مصنوعی کامل روی دستگاه خودت داری که هر وقت خواستی، حتی وسط بیابان بدون اینترنت، جوابت را می‌دهد.

این آموزش قدم‌به‌قدم است و هیچ مرحله‌ای را رد نکرده‌ام. هر قدم سه بخش دارد: هدف (چرا این کار را می‌کنیم)، اقدام دقیق (کلیک‌به‌کلیک یا دستوربه‌دستور) و نتیجه‌ای که باید ببینی (اگر این را ندیدی، یعنی جایی اشتباه رفته‌ای). آخر هر مرحله هم خطای رایجش را گفته‌ام تا گیر نکنی. برویم.

پاسخ کوتاه

  • Ollama یعنی برنامه‌ای که دانلود و اجرای مدل‌های زبانی بزرگ (LLM) را به سه دستور ساده تبدیل می‌کند: دانلود، اجرا، گفتگو.

  • کاملاً رایگان و اوپن‌سورس است و برای نصب و استفاده به حساب کاربری، ایمیل یا کارت بانکی نیاز نداری.

  • برای شروع، مدل qwen2.5:7b را پیشنهاد می‌کنم: ۴.۷ گیگابایت حجم دانلود دارد، فارسی را خوب می‌فهمد و روی هر سیستمی با ۸ گیگ رم روان اجرا می‌شود.

  • بعد از دانلود مدل، دیگر به اینترنت نیاز نداری؛ همه‌چیز روی دستگاه خودت و روی آدرس محلی localhost:11434 اجرا می‌شود.

  • اگر برنامه‌نویسی، مدل را می‌توانی از طریق API محلی هم صدا بزنی و در پروژه‌های خودت استفاده کنی.

اول زمینه: «اجرای لوکال» یعنی چه؟

قبل از اینکه دست به نصب بزنی، سه دقیقه صبر کن. اگر این سه مفهوم را بفهمی، بقیهٔ آموزش مثل آب خوردن جلو می‌رود؛ اگر هم می‌دانی‌شان، رد شو و برو سراغ «پیش‌نیازها».

مدل زبانی بزرگ (LLM) یعنی چه؟

مدل زبانی بزرگ یعنی یک برنامهٔ هوشمند که با خواندن میلیاردها صفحه متن یاد گرفته مثل انسان بنویسد و حرف بزند. وقتی به ChatGPT یا Claude پیام می‌دهی، داری با یکی از همین مدل‌ها حرف می‌زنی — فقط آن مدل روی سرورهای آن شرکت‌ها نشسته و تو از راه دور بهش وصل می‌شوی. ایدهٔ این آموزش برعکس است: همان‌جور مدلی را دانلود می‌کنیم و روی کامپیوتر خودت اجرا می‌کنیم. به این کار می‌گویند «اجرای لوکال» (local، یعنی محلی) — محلی یعنی همین‌جا، روی دستگاه تو، نه روی سرور کسی دیگر.

Ollama چیست؟

تا همین یکی دو سال پیش، اجرای مدل روی کامپیوتر خودت یک پروژهٔ فنیِ دردسرساز بود: باید پایتون نصب می‌کردی، کتابخانه‌ها را با هم سازگار می‌کردی، با خطاهای عجیب‌وغریب دست‌وپنجه نرم می‌کردی. Ollama همهٔ آن دردسر را جمع کرده و تبدیلش کرده به یک برنامهٔ معمولی که نصب می‌کنی و بعد با سه دستور ساده مدل دانلود و اجرا می‌کنی. پشت صحنه کارهای فنی (مثل شتاب‌دهی با کارت گرافیک) را خودش انجام می‌دهد و یک API استاندارد هم در اختیارت می‌گذارد تا برنامه‌های دیگر — از افزونهٔ مرورگر تا کد خودت — بتوانند به مدل وصل شوند.

چرا اصلاً مدل را لوکال اجرا کنیم؟ سه دلیل محکم

یک — حریم خصوصی واقعی. وقتی با مدل لوکال حرف می‌زنی، هیچ داده‌ای از کامپیوترت بیرون نمی‌رود. اگر می‌خواهی متن قرارداد کاری‌ات را خلاصه کنی یا دربارهٔ یک موضوع حساس سؤال بپرسی، خیالت راحت است که هیچ سروری آن را نمی‌بیند و ذخیره نمی‌کند.

دو — کار بدون اینترنت. مدل یک‌بار دانلود می‌شود و بعد برای همیشه روی دستگاه توست. توی هواپیما، توی جاده، هرجا که اینترنت نداری یا اینترنتت کند است، دستیار هوش مصنوعی‌ات همراهت است.

سه — رایگان و بدون سقف. سرویس‌های ابری معمولاً محدودیت روزانه دارند یا پول می‌گیرند. مدل لوکال را هرچقدر بخواهی صدا بزن؛ نه کسی صورت‌حساب می‌فرستد، نه وسط یک پروژهٔ مهم به سقف مصرف می‌خوری.

راستش را هم بگویم: مدل‌های لوکال امروزی در کارهای روزمره — نوشتن، ترجمه، خلاصه‌سازی، ایده‌پردازی — به‌طرز شگفت‌انگیزی خوب شده‌اند. البته در استدلال‌های خیلی پیچیده هنوز به پای بزرگ‌ترین مدل‌های ابری نمی‌رسند؛ ولی برای ۹۰ درصد کارهای روزانه همان چیزی‌اند که لازم داری.

پیش‌نیازها

قبل از شروع، این چک‌لیست را تیک بزن. اگر همه تیک خورد، تا آخر آموزش گیر نمی‌کنی:

  • سیستم‌عامل: ویندوز ۱۰ به بالا، مک (macOS Big Sur نسخهٔ ۱۱ به بالا) یا لینوکس (مثل اوبونتو ۱۸.۰۴ به بالا). روی هر سه، Ollama نسخهٔ رسمی دارد.

  • رم: دست‌کم ۸ گیگابایت برای مدل‌های ۷ میلیارد پارامتری. قانون سرانگشتی دنیای مدل‌های لوکال این است: به‌ازای هر ۱ میلیارد پارامتر، حدود ۱ گیگابایت حافظه لازم داری. یعنی مدل ۷ میلیاردی ≈ ۷ گیگ + کمی حافظه برای خود سیستم = ۸ گیگ. اگر ۱۶ گیگ رم داری، مدل‌های ۱۳ میلیاردی هم برایت باز است.

  • فضای دیسک: هر مدل چند گیگابایت جا می‌گیرد (مدل پیشنهادی ما ۴.۷ گیگ). کمی فضای خالی نگه دار.

  • اینترنت: فقط برای دانلود اولیهٔ مدل لازم است. بعدش می‌توانی کابل را بکشی و آفلاین کار کنی.

  • کارت گرافیک: لازم نیست! بدون GPU هم مدل اجرا می‌شود، فقط کمی کندتر. اگر کارت گرافیک انویدیا یا AMD داری، Ollama خودش از آن استفاده می‌کند و سرعت چند برابر می‌شود.

  • حساب کاربری: لازم نیست. نه ایمیل، نه ثبت‌نام، نه کارت بانکی.

کدام مدل را دانلود کنی؟

کتابخانهٔ Ollama صدها مدل دارد و انتخاب اول می‌تواند گیج‌کننده باشد. جدول زیر را از روی صفحهٔ رسمی کتابخانهٔ مدل‌های Ollama برداشته‌ام تا با عدد واقعی تصمیم بگیری:

مدل

حجم دانلود

رم لازم

به درد کی می‌خورد؟

qwen2.5:7b

۴.۷ گیگابایت

۸ گیگ

پیشنهاد اول من: چندزبانه (۲۹+ زبان)، فارسی را خوب می‌فهمد، کانتکست ۳۲ هزار توکنی

gemma3:4b

چند گیگابایت

۸ گیگ

ساخت گوگل، ۱۴۰+ زبان، عکس هم می‌فهمد (مالتی‌مودال)

qwen2.5:1.5b

۹۸۶ مگابایت

۴ گیگ

سیستم ضعیف یا تست سریع؛ کیفیت پایین‌تر از ۷ میلیاردی

qwen2.5:14b

۹.۰ گیگابایت

۱۶ گیگ

اگر ۱۶ گیگ رم داری و جواب‌های دقیق‌تر می‌خواهی


نتیجهٔ جدول: اگر رم‌ات ۸ گیگ است، سراغ qwen2.5:7b برو — همان که در ادامهٔ آموزش با آن کار می‌کنیم. کانتکست ۳۲ هزار توکنی‌اش یعنی می‌تواند متنی به‌بلندای حدود ۲۴ هزار کلمهٔ انگلیسی را یکجا بخواند؛ برای خلاصه‌سازی یک مقالهٔ بلند یا یک فصل کتاب کافی است.

یک نکتهٔ مهم دربارهٔ فارسی: همهٔ مدل‌ها فارسی را یکسان بلد نیستند. مدل‌هایی مثل qwen2.5 و gemma3 که رسماً چندزبانه طراحی شده‌اند، فارسی را روان می‌فهمند و جواب می‌دهند؛ بعضی مدل‌های دیگر (مثل خانوادهٔ Llama که تمرکزش روی چند زبان خاص است) در فارسی ضعیف‌ترند. پس برای کار فارسی، همان دو پیشنهاد جدول را جدی بگیر.

مرحلهٔ ۱ — دانلود و نصب Ollama

هدف: برنامهٔ Ollama را روی سیستم‌عامل خودت نصب کنی تا به‌صورت سرویس پس‌زمینه اجرا شود.

اقدام دقیق: بر اساس سیستم‌عاملت یکی از این سه راه را برو:

  • مک: فایل نصب را از صفحهٔ ollama.com/download بگیر و مثل هر برنامهٔ مکی نصبش کن. اگر Homebrew داری، راه سریع‌تر این است که در ترمینال بنویسی: brew install ollama

  • ویندوز: در منوی استارت تایپ کن PowerShell، بازش کن و این دستور را بچسبان و اینتر بزن: irm https://ollama.com/install.ps1 | iex — یا فایل OllamaSetup.exe را از همان صفحهٔ دانلود بگیر و نصب کن.

  • لینوکس: ترمینال را باز کن و این دستور را بزن: curl -fsSL https://ollama.com/install.sh | sh

نتیجه‌ای که باید ببینی: بعد از نصب، آیکون Ollama (یک لامای سفید) در نوار منو یا سینی سیستم ظاهر می‌شود و برنامه در پس‌زمینه اجرا می‌شود. روی لینوکس، نصب‌کننده معمولاً Ollama را به‌عنوان سرویس systemd ثبت می‌کند تا با هر بار روشن شدن سیستم خودش بالا بیاید.

خطای رایج: روی بعضی نسخه‌های لینوکس، نصب‌کننده وسط کار با خطای «نیاز به zstd» متوقف می‌شود. راه‌حلش ساده است: اول با sudo apt-get install zstd (اوبونتو/دبیان) آن ابزار فشرده‌سازی را نصب کن و بعد دستور نصب Ollama را دوباره بزن. من خودم دقیقاً همین خطا را در تست این آموزش گرفتم و با همین راه حل شد.

خروجی واقعی نصب Ollama با اسکریپت رسمی روی لینوکس

خروجی واقعی نصب Ollama با اسکریپت رسمی؛ آخرش نسخهٔ نصب‌شده را هم می‌بینی

مرحلهٔ ۲ — مطمئن شو نصب درست انجام شده

هدف: قبل از دانلود چند گیگابایتی مدل، مطمئن شوی Ollama سالم نصب شده و سرویسش بالاست.

اقدام دقیق: ترمینال (یا PowerShell در ویندوز) را باز کن و بنویس: ollama --version و اینتر بزن.

نتیجه‌ای که باید ببینی: یک خط مثل ollama version is 0.40.2 (شمارهٔ نسخه در سیستم تو ممکن است جدیدتر باشد). دیدن شمارهٔ نسخه یعنی Ollama نصب شده و آمادهٔ کار است. اگر به‌جایش خطای «command not found» دیدی، یعنی نصب ناقص بوده یا ترمینال را باید ببندی و دوباره باز کنی تا مسیر برنامه به سیستم اضافه شود.

خروجی واقعی دستور ollama --version بعد از نصب موفق

اگر شمارهٔ نسخه را دیدی، یعنی Ollama سالم نصب شده و آمادهٔ کار است

مرحلهٔ ۳ — دانلود اولین مدل

هدف: مدل qwen2.5 با ۷ میلیارد پارامتر را از کتابخانهٔ رسمی Ollama دانلود کنی.

اقدام دقیق: در همان ترمینال بنویس: ollama pull qwen2.5:7b و اینتر بزن. دانلود شروع می‌شود و درصد پیشرفت را زنده می‌بینی.

نتیجه‌ای که باید ببینی: بعد از رسیدن به ۱۰۰٪، پیام success چاپ می‌شود. حجم دانلود ۴.۷ گیگابایت است؛ با اینترنت معمولی خانگی بین چند دقیقه تا حدود نیم ساعت طول می‌کشد. صبور باش — این بزرگ‌ترین دانلود کل آموزش است و فقط یک‌بار انجام می‌شود.

خطای رایج: اگر دانلود نصفه قطع شد (اینترنت رفت یا لپ‌تاپ خوابید)، نگران نباش: همان دستور ollama pull qwen2.5:7b را دوباره بزن؛ Ollama از همان‌جایی که مانده ادامه می‌دهد و از اول شروع نمی‌کند.

خروجی واقعی دستور ollama list؛ مدل دانلودشده با حجمش دیده می‌شود

خروجی واقعی ollama list بعد از دانلود مدل؛ ستون SIZE حجم هر مدل را نشان می‌دهد

مرحلهٔ ۴ — اولین گفتگویت با مدل

هدف: مدل را اجرا کنی و اولین پیامت را بفرستی — لحظه‌ای که هوش مصنوعی روی کامپیوتر خودت جان می‌گیرد.

اقدام دقیق: در ترمینال بنویس: ollama run qwen2.5:7b و اینتر بزن. چند ثانیه صبر کن تا مدل در حافظه بارگذاری شود؛ بعد یک پرامپت >>> می‌بینی. حالا هرچه می‌خواهی بنویس، مثلاً: «سلام! خودت را معرفی کن.»

نتیجه‌ای که باید ببینی: مدل شروع می‌کند به نوشتن جواب، کلمه‌به‌کلمه، درست جلوی چشمانت — بدون اینکه حتی یک بایت به اینترنت برود. تبریک می‌گویم؛ داری با یک هوش مصنوعیِ کاملاً شخصی حرف می‌زنی.

دستورات داخل گفتگو: وقتی داخل چت هستی، چند دستور مخفی داری که با اسلش شروع می‌شوند. مهم‌ترینشان:

  • /bye — خروج از گفتگو و برگشت به ترمینال

  • /? — نمایش همهٔ دستورات موجود

  • /show info — دیدن مشخصات مدلی که داری باهاش حرف می‌زنی

خطای رایج: اگر بعد از ollama run خطای اتصال دیدی، یعنی سرویس Ollama بالا نیست. روی لینوکس با ollama serve در یک ترمینال جداگانه اجرایش کن؛ روی ویندوز و مک معمولاً با باز کردن برنامهٔ Ollama مشکل حل می‌شود.

گفتگوی واقعی با مدل در ترمینال با دستور ollama run

اولین گفتگوی واقعی با مدل در ترمینال — همین‌قدر ساده شروع می‌شود

مرحلهٔ ۵ — مدل‌هایت را مدیریت کن

هدف: یاد بگیری مدل‌ها را ببینی، جزئیاتشان را چک کنی و آن‌هایی را که لازم نداری پاک کنی تا دیسکت پر نشود.

اقدام دقیق: این چهار دستور، جعبه‌ابزار مدیریتی تو هستند:

دستور

یعنی چه؟

کی به کارت می‌آید؟

ollama list

فهرست مدل‌های دانلودشده با حجم و تاریخ

وقتی می‌خواهی ببینی چه مدل‌هایی داری

ollama ps

مدل‌هایی که الان در حافظه‌اند

وقتی حس می‌کنی سیستم کند شده و می‌خواهی ببینی چه چیزی رم را گرفته

ollama show qwen2.5:7b

مشخصات کامل یک مدل

قبل از دانلود مدل تازه، برای چک کردن حجم و قابلیت‌ها

ollama rm qwen2.5:7b

حذف کامل یک مدل از دیسک

وقتی مدلی را دیگر نمی‌خواهی و فضا لازم داری


تبلیغات
آکادمی پرامپت علی در یوتیوب

نتیجه‌ای که باید ببینی: خروجی ollama list باید مدل qwen2.5:7b را با حجم حدود ۴.۷ گیگابایت نشان بدهد. اگر خواستی مدلی را امتحان کنی و بعد پاکش کنی، هیچ هزینه‌ای ندارد — هر وقت خواستی با یک pull دوباره برش می‌گردانی.

مرحلهٔ ۶ — فارسی حرف بزن

هدف: مطمئن شوی مدل فارسی را درست می‌فهمد و روان جواب می‌دهد — چون قرار است دستیار فارسی‌زبان تو باشد.

اقدام دقیق: دوباره ollama run qwen2.5:7b را بزن و این بار فارسی بنویس. مثلاً بپرس: «پایتخت فرانسه کجاست و سه جای دیدنی‌اش را نام ببر.»

نتیجه‌ای که باید ببینی: مدل‌های چندزبانه‌ای مثل qwen2.5:7b و gemma3:4b فارسی را روان می‌فهمند و جواب می‌دهند — طبق صفحهٔ رسمی کتابخانهٔ Ollama، اولی از ۲۹+ زبان و دومی از ۱۴۰+ زبان پشتیبانی می‌کند. اگر جایی جوابش انگلیسی شد، بنویس «به فارسی جواب بده»؛ مدل‌ها معمولاً به زبانِ پیام تو جواب می‌دهند.

یک هشدار صادقانه: موقع آماده‌سازی این آموزش، نسخهٔ سبک نیم‌میلیاردی (qwen2.5:0.5b) را هم تست کردم — فارسی را به‌هم‌ریخته و نامفهوم تحویل داد. درسش روشن است: مدل‌های خیلی کوچک برای تست سرعت‌اند، نه برای کار جدی فارسی. اگر فارسیِ تمیز می‌خواهی، همان ۷ میلیاردی را دانلود کن.

نکتهٔ کاربردی: برای کارهای فارسی جدی، اول پیامت بنویس «به فارسیِ روان جواب بده.» همین یک جمله کیفیت خروجی را محسوس بالا می‌برد.

مرحلهٔ ۷ — دستیار فارسی خودت را بساز

هدف: یک مدل شخصی بسازی که همیشه فارسی جواب بدهد و شخصیت دلخواه تو را داشته باشد — مثلاً یک معلم صبور یا یک ویراستار سخت‌گیر.

اقدام دقیق: این قابلیت اسمش Modelfile است (یعنی «فایلِ تعریفِ مدل» — یک فایل متنی ساده که به Ollama می‌گوید مدلت چه شخصیتی داشته باشد):

  • ۱. یک پوشهٔ تازه بساز و داخلش یک فایل متنی به اسم Modelfile (بدون پسوند) درست کن.

  • ۲. این سه خط را داخلش بنویس و ذخیره کن:

FROM qwen2.5:7b PARAMETER temperature 0.7 SYSTEM "You are a helpful assistant. Always answer in fluent Persian."

  • ۳. در ترمینال، برو به همان پوشه و بنویس: ollama create دستیار-فارسی -f Modelfile

  • ۴. حالا اجرایش کن: ollama run دستیار-فارسی

نتیجه‌ای که باید ببینی: بعد از دستور create، پیام success می‌بینی و مدلت با اسم «دستیار-فارسی» در فهرست ollama list ظاهر می‌شود. از این به بعد هر وقت اجرایش کنی، بدون اینکه چیزی بگویی فارسی جواب می‌دهد. خط SYSTEM همان «دستور پنهان» است که همیشه همراه مدل می‌ماند؛ می‌توانی آن را عوض کنی — مثلاً بنویسی «تو یک معلم ریاضی صبوری که با مثال ساده توضیح می‌دهی» — و با ollama create یک شخصیت تازه بسازی.

خطای رایج: اگر create خطا داد، اول چک کن که فایل دقیقاً Modelfile نام دارد (نه Modelfile.txt — ویندوز گاهی خودش پسوند txt می‌چسباند) و دستور را از داخل همان پوشه اجرا کرده‌ای.

خروجی واقعی ساخت مدل سفارشی با Modelfile و دستور ollama create

خروجی واقعی ساخت مدل سفارشی؛ بعد از success مدل تو در فهرست ollama list می‌آید

مرحلهٔ ۸ — مدل را با API صدا بزن (برای برنامه‌نویس‌ها)

هدف: اگر کد می‌نویسی، یاد بگیری از داخل برنامه‌ات به مدل لوکال درخواست بفرستی — بدون کلید API و بدون هزینه.

اقدام دقیق: Ollama یک وب‌سرور محلی روی آدرس http://localhost:11434 بالا می‌آورد. در یک ترمینال تازه این دستور را بزن (مدل qwen2.5:7b باید از قبل pull شده باشد):

curl http://localhost:11434/api/generate -d '{"model": "qwen2.5:7b", "prompt": "What is 2+2? Answer with just the number.", "stream": false}'

نتیجه‌ای که باید ببینی: یک متن JSON برمی‌گردد که داخل فیلد response آن، جواب مدل است — در این مثال فقط عدد «۴». همین! حالا می‌توانی همین درخواست را از پایتون، جاوااسکریپت یا هر زبانی بفرستی و مدل لوکال را قلبِ اپلیکیشن خودت کنی. مستندات کامل این API در مستندات رسمی Ollama هست.

نکتهٔ کاربردی: با متغیر محیطی OLLAMA_HOST=0.0.0.0 مدل روی کل شبکهٔ خانگی‌ات در دسترس است — ولی این کار را روی اینترنت عمومی نکن؛ مدل لوکالت رمز ندارد.

خروجی واقعی API محلی Ollama؛ جواب مدل در فیلد response برمی‌گردد

خروجی واقعی API محلی؛ فیلد response همان جواب مدل است

مرحلهٔ ۹ — یک رابط گرافیکی قشنگ برایش بگذار

هدف: اگر حوصلهٔ ترمینال را نداری، یک صفحهٔ چتِ شیک مثل ChatGPT برای مدل لوکالت داشته باشی.

اقدام دقیق — راه ساده (پیشنهاد من): افزونهٔ Page Assist را از فروشگاه افزونه‌های کروم نصب کن. بعد از نصب، در تنظیماتش آدرس Ollama را http://localhost:11434 بگذار — افزونه خودش مدل‌های دانلودشده‌ات را پیدا می‌کند و یک صفحهٔ چت تمیز باز می‌کند. بدون داکر، بدون دردسر.

اقدام دقیق — راه حرفه‌ای: اگر داکر داری و یک رابط کامل با تاریخچهٔ گفتگوها، آپلود فایل و چندکاربره می‌خواهی، Open WebUI را نصب کن:

docker run -d -p 3000:8080 -v open-webui:/app/backend/data --name open-webui ghcr.io/open-webui/open-webui:main

بعد در مرورگر برو به http://localhost:3000 و در تنظیمات، اتصال Ollama را فعال کن.

نتیجه‌ای که باید ببینی: یک صفحهٔ چت در مرورگر که مدل‌های لوکالت را فهرست می‌کند — با این تفاوت که همه‌چیز روی دستگاه خودت است.

عیب‌یابی: اگر جایی گیر کردی

اگر جایی گیر کردی، راه‌حلش این‌جاست:

  • دانلود مدل نصفه ماند یا خطای شبکه داد ← همان ollama pull qwen2.5:7b را دوباره بزن؛ دانلود از همان‌جا ادامه پیدا می‌کند.

  • خطای «could not connect» یا «connection refused» ← سرویس Ollama بالا نیست. روی لینوکس در یک ترمینال جدا ollama serve را اجرا کن؛ روی ویندوز و مک برنامهٔ Ollama را باز کن و چند ثانیه صبر کن.

  • مدل خیلی کند جواب می‌دهد (کلمه‌به‌کلمه با مکث طولانی) ← سه مظنون داری: مدلی بزرگ‌تر از توان رم‌ات انتخاب کرده‌ای (برو سراغ qwen2.5:1.5b)، برنامه‌های سنگین دیگری رم را گرفته‌اند (ببندشان)، یا روی CPU اجرا می‌شود که ذاتاً کندتر است ولی طبیعی است.

  • روی لینوکس، نصب با خطای zstd متوقف شد ← اول sudo apt-get install zstd را بزن و بعد نصب Ollama را تکرار کن. (این دقیقاً همان خطایی است که من موقع تست این آموزش دیدم.)

  • پورت ۱۱۴۳۴ اشغال است ← یعنی یک نسخهٔ دیگر از Ollama (یا برنامهٔ دیگری) در حال اجراست. نسخهٔ اضافی را ببند و دوباره تلاش کن.

  • کارت گرافیک شناسایی نشد و همه‌چیز روی CPU است ← درایور گرافیکت را به‌روز کن (انویدیا: درایور CUDA؛ لینوکس AMD: نسخهٔ جدید ROCm) و سیستم را ری‌استارت کن. حتی بدون GPU هم کارت راه می‌افتد، فقط کندتر.

نکته‌های پیشرفته (اختیاری ولی خوشمزه)

  • کوانتیزیشن یعنی چه؟ مدل‌ها نسخهٔ «فشرده‌شده»‌اند (معمولاً Q4)؛ همین فشرده‌سازی مدل ۷ میلیاردی را از حدود ۱۴ گیگ به ۴.۷ گیگ می‌رساند با افت کیفیت ناچیز.

  • مدل را گرم نگه دار: به‌صورت پیش‌فرض Ollama بعد از چند دقیقه بیکاری مدل را از حافظه خالی می‌کند تا رم آزاد شود؛ اجرای بعدی چند ثانیه طول می‌کشد تا مدل دوباره بارگذاری شود. این رفتار طبیعی است، نه خطا.

  • دما (temperature) را تنظیم کن: در Modelfile دیدی که temperature 0.7 گذاشتیم. دما یعنی میزان خلاقیت مدل: نزدیک صفر یعنی جواب‌های خشک و دقیق (خوب برای کدنویسی)، نزدیک یک یعنی جواب‌های خلاقانه و متنوع (خوب برای داستان‌نویسی).

  • کتابخانه را بگرد: در ollama.com/library صدها مدل هست — از مدل‌های کدنویسی مثل qwen2.5-coder تا مدل‌های استدلالی. هر کدام را که خواستی با همان ollama pull امتحان کن؛ امتحان کردن رایگان است.

یک نکته برای تو که از ایران وصل می‌شوی

Ollama هیچ حساب کاربری نمی‌خواهد؛ پس ماجرای تحریمِ حساب پیش نمی‌آید — همه‌چیز روی دستگاه خودت است. تنها دانلود اولیهٔ مدل به اینترنت نیاز دارد؛ اگر قطع شد، اتصال را بررسی کن و با همان pull ادامه بده. فایل نصب را فقط از سایت رسمی ollama.com بگیر، نه از سایت‌های متفرقه.

جمع‌بندی

ببین چه راهی آمدی: Ollama را نصب کردی، سالم بودنش را تست کردی، یک مدل ۷ میلیارد پارامتری واقعی دانلود کردی، باهاش فارسی حرف زدی، دستیار شخصی خودت را با Modelfile ساختی و یاد گرفتی از طریق API صدایش بزنی. از این به بعد یک هوش مصنوعی داری که نه اشتراک می‌خواهد، نه اینترنت، نه اجازهٔ کسی — فقط کامپیوتر خودت و کمی کنجکاوی.

قدم‌های بعدی اگر هوس کردی عمیق‌تر بروی: مدل‌های کدنویسی کتابخانه را امتحان کن و ببین چطور در ساخت خروجی‌های تعاملی کمکت می‌کنند؛ اگر دوست داری قابلیت‌های دستیارهای ابری را هم بشناسی، آموزش حافظهٔ ChatGPT و آموزش دیپ ریسرچ را بخوان تا بفهمی کدام کار را به مدل لوکالت بسپاری و کدام را به ابر؛ و برای ایده‌های خلاقانهٔ تصویری، آموزش کانوس گوگل هم منتظر توست.

پرسش‌های متداول

آیا Ollama واقعاً رایگان است؟ پس مدل‌ها از کجا می‌آیند؟

بله، خود Ollama رایگان و اوپن‌سورس است. مدل‌ها را شرکت‌ها و جوامع متن‌باز (مثل علی‌بابا برای Qwen و گوگل برای Gemma) با مجوز باز منتشر کرده‌اند و Ollama فقط آن‌ها را بسته‌بندی و توزیع می‌کند. نه اشتراکی هست، نه سقف مصرفی، نه تبلیغاتی.

آیا بدون اینترنت هم کار می‌کند؟

بعد از اینکه مدل را یک‌بار دانلود کردی، بله — کاملاً آفلاین. فقط دانلود اولیهٔ مدل و به‌روزرسانی‌ها به اینترنت نیاز دارند.

فرق مدل لوکال با ChatGPT چیست؟

ChatGPT روی سرورهای OpenAI اجرا می‌شود؛ قوی‌تر ولی با محدودیت مصرف و ارسال داده به سرور آن‌ها. مدل لوکال خصوصی، رایگان و نامحدود است ولی در استدلال‌های خیلی پیچیده یک پله پایین‌تر. خیلی‌ها هر دو را دارند: کار حساس لوکال، کار سنگین ابری.

می‌شود روی گوشی هم اجرا کرد؟

خود Ollama رسماً فقط برای ویندوز، مک و لینوکس است. ولی ترفند رایج این است: Ollama را روی کامپیوتر خانه اجرا کنی و از طریق شبکهٔ خانگی (با همان تنظیم OLLAMA_HOST که گفتیم) از گوشی بهش وصل شوی.

مدل‌ها فارسی را خوب بلدند؟

مدل‌های چندزبانه‌ای مثل qwen2.5 و gemma3 فارسی را روان می‌فهمند و جواب می‌دهند. ولی یک هشدار صادقانه: در همهٔ مدل‌ها گاهی جواب فارسی کمی «ترجمه‌ای» از آب درمی‌آید؛ با همان جملهٔ راهنمای «به فارسیِ روان جواب بده» کیفیت خیلی بهتر می‌شود.

دیسم پر شد؛ چطور مدل‌های اضافی را پاک کنم؟

با ollama list ببین چه داری و با ollama rm نام-مدل آن‌هایی را که نمی‌خواهی حذف کن. هر وقت پشیمان شدی، با یک pull برمی‌گردند.

آیا حرف‌هایم جایی ذخیره یا ارسال می‌شود؟

نه. مدل روی دستگاه خودت اجرا می‌شود و گفتگوها از کامپیوترت بیرون نمی‌روند — مگر اینکه خودت از رابط‌هایی مثل Open WebUI استفاده کنی که تاریخچه را (باز هم روی دستگاه خودت) نگه می‌دارند.

منابع

برچسب‌ها:هوش مصنوعیهوش مصنوعی مولدبرنامه‌نویسی
اشتراک‌گذاری:

مطالب مرتبط

سه صفحهٔ آیفون از قابلیت پرو مجازی ChatGPT: کارت محصول دامن با دکمهٔ Try on، دوربین سلفی و تصویر پروشده
آموزش و راهنما

آموزش پرو مجازی لباس با ChatGPT؛ لباس را قبل از خرید روی خودتان ببینید

ChatGPT حالا کنار لباس‌ها و اکسسوری‌های نتیجه‌های خرید دکمهٔ Try on دارد: یک سلفی بدهید و لباس را روی خودتان ببینید. قدم‌به‌قدم یاد بگیرید لباس را پیدا و پرو کنید، عکس لباس دلخواهتان را امتحان کنید، محصولات را در Favorites ذخیره کنید و سلفی‌تان را پاک کنید.

ویرایشگر ویدیوی گوگل فوتوز روی گوشی اندرویدی با ابزارهای Auto، Crop، Adjust، Filters و Mute
آموزش و راهنما

آموزش ویرایش سریع ویدیو در گوگل فوتوز؛ دکمهٔ تازهٔ ویرایش قبل از ارسال

گوگل فوتوز در اندروید حالا کنار پیش‌نمایش ویدیو در صفحهٔ اشتراک‌گذاری یک دکمهٔ ویرایش سریع دارد؛ قدم‌به‌قدم یاد بگیرید ویدیو را قبل از فرستادن کوتاه کنید، کادرش را ببرید، رنگ، متن، صدا و سرعتش را تنظیم کنید و بفرستید.

تصویر رسمی واتساپ از صفحهٔ Parental controls با گزینه‌های Privacy settings، Meta AI، Status و Channels و فهرست فعالیت نوجوان
آموزش و راهنما

آموزش کنترل والدین واتساپ برای نوجوانان؛ راه‌اندازی قدم‌به‌قدم

واتساپ حالا کنترل والدین برای نوجوانان ۱۳ تا ۱۷ ساله دارد: با یک کد QR و پین شش‌رقمی حساب خودتان را به حساب فرزندتان وصل کنید، حریم خصوصی، Meta AI، وضعیت و کانال‌ها را تنظیم کنید و از فعالیت‌های مهم خبردار شوید؛ بدون اینکه پیام‌هایش را بخوانید.

عضویت در خبرنامه

آخرین اخبار هوش مصنوعی و فناوری را در ایمیل خود دریافت کنید.

پس از عضویت یک ایمیل تأیید برایتان ارسال می‌شود. هر زمان می‌توانید اشتراک خود را لغو کنید و ایمیل شما با شخص ثالثی به اشتراک گذاشته نمی‌شود.