بلاگ ابرفردوسی > آموزش سرور هوش مصنوعی : آموزش نصب Ollama روی ویندوز (اجرای محلی هوش مصنوعی)

آموزش نصب Ollama روی ویندوز (اجرای محلی هوش مصنوعی)

نصب ollama روی ویندوز

اجرای محلی مدل‌های زبانی (Local LLM) تا پیش‌از این همیشه با کابوس کانفیگ پایتون، پکیج‌های سنگین و وابستگی‌های پیچیده سیستم‌عامل همراه بوده است. اما ابزار اولاما آمد تا کل این فرایند فرسایشی را تغییر دهد. نصب Ollama روی ویندوز به شما اجازه می‌دهد بدون درگیرشدن با تنظیمات پیچیده فنی، فرایند اجرای local llm را به‌صورت کاملاً آفلاین و بومی روی سیستم شخصی خود تجربه کنید. با راه اندازی اولاما، شما عملاً یک موتور پردازشی قدرتمند در اختیار دارید که فرایند اجرای مدل هوش مصنوعی روی ویندوز را تا حد چند دستور ساده در محیط ترمینال خلاصه می‌کند.

در این مقاله ابر فردوسی، آموزش نصب و راه‌اندازی Ollama روی ویندوز را قدم‌به‌قدم جلو می‌بریم. باهم بررسی خواهیم کرد که پیش‌نیازهای سخت‌افزاری و وضعیت درایورهای کارت گرافیک شما باید چگونه باشد، نحوه دانلود رسمی و نصب آن چطور انجام می‌شود، فرمان‌های CLI برای مدیریت مدل‌ها کدامند و در نهایت چطور خطاهای رایج دسکتاپ یا محدودیت سخت‌افزاری سیستم‌های قدیمی را برطرف کنید.

پیش‌نیازهای اصلی برای نصب Ollama روی ویندوز

بخش سخت‌افزاری / نرم‌افزاریحداقل سیستم موردنیازسیستم پیشنهادی (تجربه روان)
سیستم‌عاملویندوز 10 (64-bit)ویندوز 11
پردازنده (CPU)Intel Core i5 / AMD Ryzen 5Intel Core i7 / AMD Ryzen 7
کارت گرافیک (GPU)NVIDIA (4GB VRAM)NVIDIA RTX Series (8GB+ VRAM)
حافظه موقت (RAM)8 گیگابایت16 یا 32 گیگابایت
نوع حافظه دیسکHDD (با سرعت پایین)NVMe SSD

قبل‌از اینکه بااشتیاق به‌سراغ دکمه دانلود بروید، باید تکلیف یک چیز را روشن کنیم: اولاما خودش ابزار سبکی است، اما مدل‌های زبانی که قرار است درون آن بارگذاری شوند، اشتهای عجیبی برای اشغال منابع سخت‌افزاری سیستم شما دارند. برای اینکه فرایند راه اندازی ollama با موفقیت انجام شود و وسط کار با خطاهای عجیب روبرو نشوید، سیستم شما باید استانداردهای مشخصی داشته باشد.

روی ویندوز ۷ و ۸ نصب نمی‌شود

اجازه بدهید همین ابتدا خیال‌تان را راحت کنم؛ اگر در وب، بین عباراتی مثل آموزش نصب Ollama روی ویندوز 7 یا نسخه ۸ چرخیده‌اید، بهتر است وقت خود را تلف نکنید. معماری اولاما برای هسته مدرن ویندوز و درایورهای گرافیکی جدید بهینه‌سازی شده است.

  • نسخه‌های پشتیبانی‌شده: شما به آموزش نصب Ollama روی ویندوز 11 یا ویندوز 10 (نسخه 22H2 به بالا) نیاز دارید. سیستم‌عامل باید حتماً ۶۴ بیتی باشد.
  • دسترسی ادمین: برای نصب اولیه و ثبت سرویس در پس‌زمینه سیستم، داشتن دسترسی Administrator الزامی است.

سخت‌افزار؛ رم (RAM) و گرافیک

همان‌طورکه می‌دانید برای اجرای local AI بدون اینترنت، بار اصلی پردازش روی دوش کارت گرافیک (GPU) و حافظه موقت (RAM) شما است. اگر کارت گرافیک مجزا ندارید، اولاما به‌صورت خودکار روی حالت CPU سوییچ می‌کند، اما سرعت پاسخ‌دهی مدل‌ها به‌شدت افت خواهد کرد.

  • کارت گرافیک (GPU): اولویت اول با کارت‌های انویدیا (NVIDIA) با معماری پشتیبانی‌شده از CUDA است. کارت‌های AMD نیز با معماری ROCm پشتیبانی می‌شوند. حداقل به ۴ گیگابایت VRAM (حافظه گرافیک) نیاز دارید.
  • حافظه موقت (RAM): برای اجرای مدل‌های سبک (مثل مدل‌های ۳ میلیاردی)، ۸ گیگابایت رم کافی است. اما برای مدل‌های استاندارد مثل لاما ۳ (نسخه 8B)، حداقل به ۱۶ گیگابایت رم نیاز خواهید داشت.
  • فضای ذخیره‌سازی: استفاده از حافظه SSD در اینجا پیشنهادی نیست، بلکه اجباری است! اگر مدل‌ها را روی هارد دیسک‌های قدیمی (HDD) نصب کنید، سرعت لود شدن مدل‌ها کلافه‌کننده خواهد بود. خود نرم‌افزار فضای کمی می‌گیرد اما هر مدل بین ۴ تا ۴۰ گیگابایت فضا لازم دارد.
⚠️ هشدار خیلی مهم
قبل‌از شروع مراحل نصب، حتماً درایور کارت گرافیک خود را به آخرین نسخه موجود آپدیت کنید. اولاما برای شناسایی هسته‌های پردازشی کارت گرافیک شما، کاملاً به درایورهای به‌روز وابسته است. نسخه‌های قدیمی درایور باعث می‌شود سیستم به اجبار روی CPU سوییچ کند و سرعت پردازش کابوس‌وار شود.

تفاوت نصب بومی (Native) با حالت Docker یا سرویس پس‌زمینه

وقتی اقدام به نصب اولاما روی ویندوز می‌کنید، این ابزار به‌عنوان یک ویندوز سرویس (Windows Service) در پس‌زمینه سیستم شما مستقر می‌شود.

  • حالت بومی (سرویس ویندوز): در این حالت، یک آیکون کوچک در کنار ساعت ویندوز ظاهر می‌شود. این سرویس همیشه آماده است و یک وب‌سرور محلی روی پورت 11434 می‌سازد تا بتوانید ازطریق ترمینال یا API به آن وصل شوید.
  • حالت CLI: خود اولاما رابط کاربری گرافیکی (GUI) برای چت‌کردن ندارد. تمام تعامل شما با آن ازطریق محیط Command Prompt یا PowerShell و با دستورات متنی انجام خواهد شد.

آموزش گام‌به‌گام دانلود و نصب اولاما در ویندوز

نصب ollama روی ویندوز

حالا که خیال‌تان از بابت پیش‌نیازهای سخت‌افزاری راحت شد، وقت نصب و راه‌اندازی اولاما است. کل این فرایند کمتر از ۵ دقیقه زمان می‌برد، اما چند نکته کلیدی دارد که بی‌توجهی به آن‌ها بعداً درایو سیستم‌تان را فلج می‌کند!

گام اول- دانلود فایل نصبی نرم‌افزار

در حالت عادی، دریافت فایل اصلی بسیار ساده است و نیاز به هفت‌خوان رستم ندارد:

۱. مرورگر خود را باز کنید و به صفحه رسمی دانلود اولاما برای ویندوز بروید.

۲. روی دکمه بزرگ Download for Windows کلیک کنید تا فایل OllamaSetup.exe (با حجمی حدود 1.3 گیگابایت) دانلود شود.

لینک دانلود کمکی از سایت داخلی

به‌دلیل نوسانات سرعت اینترنت بین‌الملل یا اختلال در دانلود مستقیم از ریپازیتوری‌های گیت‌هاب، ممکن است موفق به دانلود نشوید. اگر با این مشکل مواجه شدید، می‌توانید از لینک زیر استفاده کنید تا فایل را با ترافیک نیم‌بها و سرعت پایدار دریافت کنید.

گام دوم- اجرای فایل و نصب یک‌کلیکی

برعکس بقیه نرم‌افزارهای ویندوزی که تعهدنامه‌های طولانی جلویتان می‌گذارند و ده بار آدرس نصب را می‌پرسند، اولاما به‌شدت مینیمال طراحی‌شده است:

  • روی فایل دانلود شده (OllamaSetup.exe) دو بار کلیک کنید.
  • در پنجره باز شده، فقط‌وفقط روی دکمه Install کلیک کنید.
  • نرم‌افزار در عرض چند ثانیه، فرایند نصب llama روی ویندوز را در پس‌زمینه جلو می‌برد و تمام!
پنجره نصب ollama روی ویندوز

گام سوم- اتمام نصب و بررسی وضعیت سرویس

پس‌از پایان نصب، معمولا پنجره اولاما باز خواهد شد. برای اینکه مطمئن شوید فرایند اجرای Ollama در ویندوز به‌درستی استارت خورده است، به گوشه سمت راست پایین صفحه (System Tray) در کنار ساعت ویندوز نگاه کنید. اگر آیکون کوچک اولاما (که شبیه به یک لاما یا شتر لاما است) را دیدید، یعنی موتور اولاما روشن است و گوش‌به‌زنگ دستورات شما است.

پنجره و آیکون نصب اولاما

ترفند تغییر مسیر ذخیره‌سازی مدل‌ها (نجات درایو C)

اولاما به‌صورت پیش‌فرض خودش را در درایو C نصب می‌کند و مدل‌های هوش مصنوعی غول‌پیکری که بعداً دانلود می‌کنید را هم در مسیر C:\Users\YourName\.ollama\models ذخیره می‌کند. این یعنی بعداز دانلود دو یا سه مدل، درایو ویندوز شما قرمز خواهد شد! ازآنجاکه خود برنامه دکمه‌ای برای تغییر مسیر ندارد، باید از این ترفند سیستم‌عاملی استفاده کنید:

۱. منوی استارت ویندوز را باز کنید، عبارت Environment Variables را سرچ کنید و وارد آن شوید.

۲. در پنجره بازشده و در بخش System Variables، روی دکمه New کلیک کنید.

تنظیمات System Variables

۳. نام متغیر (Variable name) را دقیقاً عبارت OLLAMA_MODELS بگذارید.

۴. مقدار متغیر (Variable value) را آدرس پوشه‌ای در یک درایو خلوت و پرسرعت (مثل D:\OllamaModels) قرار دهید و تنظیمات را OK کنید.

تنظیم Variable value برای اولاما

۵. در آخر، یک‌بار روی آیکون اولاما کنار ساعت راست‌کلیک کنید و Quit را بزنید، سپس برنامه را دوباره اجرا کنید تا تغییرات اعمال شوند.

هم‌چنین در بخش تنظیمات خودِ نرم‌افزار ویندوز اولاما هم می‌توانید محل ذخیره مدل‌ها را تغییر دهید.

تنظیم محل ذخیره‌سازی مدل‌ها در تنظیمات اولاما

اولین اجرای Ollama و فراخوانی مدل‌های هوش مصنوعی

وقتی مراحل نصب تمام می‌شود، اولاما درست مثل یک مغز آماده اما کاملاً خالی رفتار می‌کند. این نرم‌افزار در حقیقت یک پلتفرم یا یک میزبان است و هیچ مدل هوش مصنوعی یا فایل زبانی به‌صورت پیش‌فرض درون آن وجود ندارد؛ بنابراین نباید منتظر بازشدن یک برنامه گرافیکی شبیه به چت‌جی‌پی‌تی باشید. تمام کار ما از این به بعد در بستر خط فرمان جلو می‌رود.

گام اول- مطمئن شوید اولاما فعال است

قبل‌از هرچیز، باید تست کنیم که آیا موتور برنامه در سیستم شما درحال فعالیت است یا خیر.

۱. محیط PowerShell یا Command Prompt (CMD) ویندوز را باز کنید.

۲. دستور زیر را تایپ کنید و کلید Enter را بزنید:

ollama --version
بررسی ورژن اولامای نصب شده

اگر بعداز زدن اینتر، شماره نسخه برنامه (مثلاً ollama version is 0.1.48) را دیدید، یعنی اجرای Ollama در ویندوز با موفقیت در جریان است و سیستم این ابزار را می‌شناسد. اگر با خطای command not found مواجه شدید، یک‌بار سیستم را ری‌استارت کنید یا مطمئن شوید آیکون اولاما درکنار ساعت ویندوز روشن است.

فرمان‌های اصلی CLI برای مدیریت مدل‌ها

مستندات رسمی اولاما نشان می‌دهد که برای مدیریت، دانلود و حذف مدل‌ها نیازی به کدهای پیچیده ندارید و تمام فرایند راه‌اندازی اولاما و کار با آن حول ۴ دستور کلیدی می‌چرخد که بهتر است آن‌ها را به خاطر بسپارید:

فرمانعملکرد
ollama run [model_name]اگر مدل روی سیستم نباشد، ابتدا آن را دانلود می‌کند و بلافاصله محیط چت زنده را در ترمینال باز می‌کند
ollama pull [model_name]اگر فقط می‌خواهید یک مدل را دانلود و ذخیره کنید اما فعلاً قصد چت‌کردن یا به‌کارگرفتن آن را ندارید
ollama listلیست تمام مدل‌های هوش مصنوعی که تا الان روی هارد دیسک ویندوزتان دانلود و ذخیره کرده‌اید را به شما نشان می‌دهد همراه با حجم هر کدام
ollama rm [model_name]اگر فضای درایوتان پُر شده و می‌خواهید یک مدل سنگین را به‌طور کامل از روی سیستم پاک کنید، این دستور به کارتان می‌آید

تست زنده اجرای اولین مدل و چت آفلاین

بیایید برای نمونه، یک مدل فوق‌العاده سبک و سریع را بالا بیاوریم تا ببینیم فرایند اجرای local AI بدون اینترنت چطور کار می‌کند. در محیط ترمینال، دستور زیر را وارد کنید:

ollama run llama3
راه‌اندازی مدل llama3 با اولاما

چه اتفاقی رخ می‌دهد؟

اولاما ابتدا بررسی می‌کند که آیا فایل‌های چند گیگابایتی این مدل روی دیسک شما وجود دارد یا خیر. ازآنجاکه این اولین اجرای شما است، برنامه شروع به دانلود لایه‌های مختلف مدل از سرور رسمی می‌کند و یک درصد پیشرفت به شما نشان می‌دهد. پس‌‌از اتمام دانلود، خط فرمان تغییر شکل می‌دهد و نشانه <<< ظاهر می‌شود. حالا سیستم شما بدون نیاز به حتی یک کیلوبایت اینترنت، تبدیل به یک هوش مصنوعی اختصاصی شده است!

⚠️ هشدار خیلی مهم
ارور دانلود مدل به‌دلیل تحریم یا اختلال شبکه
سرورهای توزیع مدل اولاما (Ollama Registry) گاهی آی‌پی‌های ایران را مسدود می‌کنند یا به‌دلیل اختلالات موقتی شبکه، دانلود لایه‌های سنگین مدل (Manifest Error یا Connection Timeout) شکست می‌خورد. اگر دیدید درصد دانلود جلو نمی‌رود، دو راهکار دارید:
۱. از vpn برای دانلود مدل استفاده کنید.
۲. مدل را از سایت‌های داخلی دان‍لود کنید و به اولاما معرفی کنید.

چطور از محیط چت ترمینال خارج شویم؟

یکی از کلافه‌کننده‌ترین تجربه‌های کاربران تازه‌کار این است که بعداز تمام‌شدن کارشان با هوش مصنوعی، نمی‌دانند چطور باید محیط چت را ببندند و به خط فرمان عادی ویندوز برگردند! زدن دکمه‌های Ctrl + C همیشه کارساز نیست. فوت کوزه‌گری این است که در خط چت، عبارت /bye را تایپ کنید و اینتر بزنید تا اولاما با احترام محیط چت را ببندد و منابع رم سیستم را آزاد کند.

راهنمای انتخاب بهترین مدل‌های Ollama برای ویندوز

بزرگ‌ترین اشتباهی که کاربران بعداز نصب Ollama روی ویندوز مرتکب می‌شوند، این است که بدون توجه به توان سخت‌افزاری سیستم خود به‌سراغ دانلود سنگین‌ترین مدل‌های زبانی می‌روند. شما باید بدانید که در دنیای هوش مصنوعی لوکال، تعداد پارامترهای یک مدل (مثلاً 3B یا 8B یا 70B) حکم حجم موتور یک خودرو را دارد؛ هرچه بزرگ‌تر باشد قدرت بیشتری دارد، اما بنزین (منابع رم و گرافیک) بیشتری هم می‌سوزاند.

برای اینکه بعداز راه‌اندازی بهترین بازدهی را بگیرید، باید مدل‌ها را براساس مشخصات فنی دسکتاپ خود دسته‌بندی و انتخاب کنید.

۱. مدل‌های سبک برای سیستم‌های معمولی

اگر لپ‌تاپ یا کامپیوتر شما کارت گرافیک مجزای قدرتمندی ندارد یا حافظه رم سیستم‌تان ۸ گیگابایت است، باید به‌سراغ مدل‌های در لایه سبک (زیر ۴ میلیارد پارامتر) بروید. این مدل‌ها به‌شدت بهینه‌سازی شده‌اند و سرعت پاسخ‌دهی (Token per Second) بسیار بالایی روی سیستم‌های خانگی دارند.

  • مدل Llama 3.2 (نسخه 1B و 3B): شاهکار جدید متا که با وجود حجم بسیار کم (حدود ۲ گیگابایت)، در درک زبان طبیعی و کارهای متنی روزمره فوق‌العاده عمل می‌کند.
  • مدل Phi-3 (نسخه 3.8B): مدل اختصاصی مایکروسافت که طوری آموزش دیده که روی سخت‌افزارهای ضعیف، خروجی در حدّ مدل‌های بزرگ‌تر به شما تحویل دهد.
  • مدل Qwen2.5 (نسخه 1.5B و 3B): اگر اولویت شما زبان فارسی است، این مدل به‌طرز شگفت‌انگیزی ادبیات و متون فارسی را بهتر از رقبای غربی خود می‌فهمد.

۲. مدل‌های میان‌رده و بزرگ برای سیستم‌های رندرینگ و گیمینگ

اگر یک کارت گرافیک سری RTX انویدیا با حداقل ۸ گیگابایت حافظه اختصاصی (VRAM) دارید و رم سیستم شما ۱۶ یا ۳۲ گیگابایت است، می‌توانید پتانسیل واقعی نصب اولاما روی ویندوز را با مدل‌های پیشرفته‌تر (بین ۷ تا ۱۴ میلیارد پارامتر) تجربه کنید. این مدل‌ها برای کارهای پیچیده مثل برنامه‌نویسی، تحلیل داتا و کارهای خلاقانه ساخته شده‌اند.

  • مدل Llama 3 / 3.1 (نسخه 8B): استاندارد طلایی مدل‌های لوکال درحال حاضر. هوش و منطق این مدل شما را شگفت‌زده خواهد کرد، اما حداقل به ۵ گیگابایت حافظه گرافیک خالی نیاز دارد.
  • مدل Gemma 2 (نسخه 9B): مدل متن‌باز گوگل که برای استدلال‌های منطقی و پاسخ‌های دقیق، یک رقیب سرسخت برای لاما محسوب می‌شود.
  • مدل Mistral (نسخه 7B): یک مدل فرز و باهوش اروپایی که کامیونیتی توسعه‌دهندگان علاقه خاصی به آن دارند.
  • مدل Gemma 4 (نسخه 12B): جدیدترین شاهکار بومی و چندوجهی گوگل که انقلابی در مدل‌های لوکال دسکتاپ به‌پا کرده است. این مدل به لطف معماری نوآورانه خود، فرایند پردازش متن، تصویر و صوت را به‌صورت کاملاً یکپارچه انجام می‌دهد. با اینکه قدرت پردازش و استدلال متنی آن با غول‌های هوش مصنوعی رقابت می‌کند، اما برای اجرای روان به حداقل ۱۶ گیگابایت رم سیستم و کارت گرافیک‌های مدرن با VRAM بالا نیاز دارد.

جدول تطبیق مدل‌های اولاما با سخت‌افزار ویندوز

اولاما به‌صورت پیش‌فرض مدل‌ها را در حالت کوانتایزشده (معمولاً نسخه Q4_K_M که فشرده‌شده و بهینه است) دانلود می‌کند. جدول زیر به شما نشان می‌دهد که هر مدل چقدر فضا و رم می‌خواهد:

نام هوش مصنوعی در اولاماحجم فایل مدلحداقل رم و گرافیک مورد نیازسرعت و بازدهی روی سیستم معمولی
llama3.2:1b~ ۱.۳ گیگابایت8GB RAM / CPU عادیموشک! (بسیار سریع)
llama3.2:3b~ ۲.۰ گیگابایت8GB RAM / ۱ یا ۲ گیگابایت VRAMبسیار روان و راضی‌کننده
phi3:mini~ ۲.۲ گیگابایت8GB RAM / ۴ گیگابایت VRAMروان و دقیق
llama3:8b~ ۴.۷ گیگابایت16GB RAM / ۶ الی ۸ گیگابایت VRAMسرعت متوسط (نیاز به GPU)
gemma2:9b~ ۵.۵ گیگابایت16GB RAM / ۸ گیگابایت VRAMکمی سنگین (نیازمند گرافیک قوی)
gemma4:12b~ ۷.۶ گیگابایت (نسخه کوانتایزشده)16 GB RAM / 8 GB VRAMسنگین و پردازش دقیق (نیازمند کارت گرافیک قوی)
💡 ترفند کاربردی
فرمول محاسبه رم برای مدل‌ها
مستندات رسمی و فنی اولاما یک قانون کلیدی برای محاسبات دسکتاپ دارد: برای اجرای هر مدل زبانی در حالت کوانتایز شده ۴ بیتی، شما به‌ازای هر ۱ میلیارد پارامتر، به حدود ۰.۶ گیگابایت حافظه (RAM یا VRAM) نیاز دارید و باید ۱ الی ۲ گیگابایت هم سهم خود سیستم‌عامل ویندوز کنار بگذارید.
مثلاً یک مدل 8B به حدود 8*0.6 = 4.8 گیگابایت حافظه اختصاصی نیاز دارد. اگر این مقدار فضای خالی در حافظه گرافیک شما نباشد، اولاما مدل را لایه‌به‌لایه روی RAM سیستم پخش می‌کند و این یعنی سرعت پاسخ‌دهی به‌شدت افت خواهد کرد.

رفع مشکلات و عیب‌یابی رایج Ollama در ویندوز

در خط فرمان و پردازش‌های لوکال، هیچ‌چیز همیشه ایده‌آل جلو نمی‌رود. گاهی بعد از راه‌اندازی اولاما با رفتارهای عجیبی مواجه می‌شوید که در مستندات خشک سایت اصلی هم راه‌حلی برایشان نیست. در این بخش مشکلات متداول کاربران در ویندوز را با روش‌های متنوعِ عارضه‌یابی برطرف می‌کنیم تا کانفیگ شما به بن‌بست نخورد.

۱- قفل شدن اولاما در پس‌زمینه (ظاهر نشدن آیکون نرم‌افزار)

گاهی روی آیکون برنامه کلیک می‌کنید اما هیچ اتفاقی نمی‌افتد و ترمینال هم خطای عدم دسترسی می‌دهد. این مشکل معمولاً ناشی از یک پروسس زامبی (Zombie Process) است؛ یعنی نسخه قبلی اولاما در پس‌زمینه قفل کرده و اجازه اجرای نسخه جدید را نمی‌دهد. به‌جای چرخیدن در تسک‌مدیجر، ترمینال را باز کنید و با این تک‌دستور، فرایند مزاحم را به زور بُکشید:

taskkill /f /im ollama.exe

حالا اگر می‌خواهید موتور برنامه را به‌صورت دستی و با لاگ زنده استارت بزنید تا ببینید دردش چیست، دستور زیر را وارد کنید تا برنامه در حالت Serve بالا بیاید:

ollama serve

۲- خطاهای دانلود مدل (Diagnostic Matrix)

خطاهای زمان دانلود لایه‌های هوش مصنوعی (مثل لاما یا مدل چندوجهی Gemma 4 12B) معمولاً به دو دلیلِ کلی رخ می‌دهند. برای اینکه بدانید در هر موقعیت باید چه کار کنید، جدول زیر مسیر را در چند ثانیه به شما نشان می‌دهد:

خطای مشاهده‌شده در ترمینالعلت اصلی خطاراه‌حل فوری کفِ سروری
Error: shattered layer یا درصد دانلود جلو نمی‌رودفیلترینگ، تحریم یا نوسان شدید شبکه بین‌المللست کردن DNS روی کارت شبکه یا ست کردن پراکسی ترمینال با دستور HTTP_PROXY
download failed: no space leftکمبود فضا در دیسک درایو پیش‌فرضدرایو C را خالی کنید یا طبق ترفند بخش‌های قبل، متغیر OLLAMA_MODELS را به یک درایو خلوت‌تر سوییچ کنید. (توجه: دیسک شما باید حداقل ۲ برابر حجم مدل فضای خالی داشته باشد)

۳- نادیده گرفتن کارت گرافیک

یکی از چالش‌های پیشرفته هنگام اجرای Ollama در ویندوز این است که متون خروجی کلمه‌به‌کلمه و با تاخیری کابوس‌وار (مثل ماشین تایپ‌های قدیمی) ظاهر می‌شوند. این یعنی قدرت پردازش به‌جای کارت گرافیک، روی دوش پردازنده اصلی (CPU) افتاده است. برای حل مشکل کافی است در زمان چت با مدل، یک تَب جدید در پاورشل باز کنید و وضعیت کارت گرافیک خود را با دستور زیر اسکن کنید:

nvidia-smi

اگر میزان مصرف VRAM (حافظه گرافیک) تغییر نکرده باشد، اولاما گرافیک شما را نمی‌بیند.

  • علت اول: درایور انویدیا شما قدیمی است و هسته‌های CUDA را فعال نکرده است؛ درایور را فوراً آپدیت کنید.
  • علت دوم (فرمول سرریز حافظه): مدل انتخابی شما بزرگ‌تر از حافظه کارت گرافیک‌تان است. مثلاً اگر یک کارت گرافیک ۶ گیگابایتی دارید و مدل غول‌پیکری را لود کرده‌اید، اولاما به ناچار بخشی از لایه‌های مدل را روی رم معمولی سیستم پخش می‌کند که سرعت آن یک‌دهم گرافیک است. راه‌حل؟ سوییچ به مدل‌های سبک‌ترِ کوانتایز شده (مثل نسخه‌های 3B یا 1B لاما).

۴- خطای Connection Refused روی آدرس Localhost

اولاما به‌صورت بومی یک وب‌سرور محلی روی پورت 11434 باز می‌کند تا افزونه‌های مرورگر یا کدهای پایتون شما بتوانند به آن وصل شوند. اگر این آدرس پاسخ نمی‌دهد، احتمالاً برنامه‌ای دیگر (مثل داکر یا وب‌سرورهای محلی دیگر) روی این پورت خیمه زده است. اگر می‌خواهید اولاما را از این بن‌بست خارج کنید تا از روی یک سیستم دیگر در شبکه محلی یا یک داکر بیس مجزا هم قابل‌دسترسی باشد، باید رفتار شبکه آن را تغییر دهید:

۱. سیستم متغیرهای ویندوز (Environment Variables) را باز کنید.

۲. یک متغیر جدید با نام OLLAMA_HOST بسازید.

۳. مقدار آن را روی 0.0.0.0:11434 تنظیم کنید تا برنامه روی تمامی آی‌پی‌های شبکه گوش‌به‌زنگ شود.

⚠️ هشدار خیلی مهم
برخی از آنتی‌ویروس‌های دسکتاپ یا Windows Defender ویندوز، به‌محض اینکه اولاما اقدام به بازکردن وب‌سرور محلی می‌کند به اشتباه فایروال را می‌بندند و فرایند شبکه آن را مسدود می‌کنند. اگر بعداز نصب اولاما روی ویندوز با خطای تداخل شبکه محلی مواجه شدید، موقتاً آنتی‌ویروس را غیرفعال کنید یا پوشه نصب اولاما را در لیست Exclusions آنتی‌ویروس قرار دهید.

نصب اولاما برای سیستم‌های قدیمی و ضعیف (معرفی جایگزین)

واقعیت این است که ابزارهایی مثل اولاما با دموکراتیزه کردن هوش مصنوعی، لذت کار با مدل‌های لوکال را به ما چشاندند؛ اما حقیقت فنی دسکتاپ‌ها تغییر نکرده است: هیچ ترفند سیستم‌عاملی یا ترفند خط فرمانی نمی‌تواند یک کارت گرافیک آنبورد یا پردازنده قدیمی را مأمور پردازش سنگین لایه‌های شبکه‌های عصبی کند. وقتی به‌سراغ مدل‌های دقیق‌تر با تعداد پارامتر بالا (مانند مدل چندوجهی Gemma 4 12B یا نسخه‌های بزرگ لاما) می‌روید، سیستم‌های خانگی یا ریپ می‌زنند یا با خطای اتمام حافظه کرش می‌کنند.

خرید یک کارت گرافیک قوی با بیش‌از ۱۶ گیگابایت VRAM هم برای کارهای تحقیقاتی یا توسعه پکیج‌های شخصی، ازنظر اقتصادی توجیهی ندارد. در این موقعیت، عاقلانه‌ترین پل منطقی، سوییچ از پردازش دسکتاپ به سرور هوش مصنوعی است.

برای اینکه متوجه تفاوت بازدهی پردازش شوید، جدول مقایسه‌ای زیر به‌نحو خوبی پاسخ سؤال شما را می‌دهد:

معیار ارزیابیاجرای لوکال روی کامپیوتر معمولیاجرای اولاما روی سرور جی‌پی‌یو (GPU) ابری
سرعت تولید متن (Tokens/Sec)بسیار کند (کلمه‌به‌کلمه و با وقفه)آنی و با بالاترین نرخ پاسخ‌دهی
محدودیت در انتخاب مدلفقط مدل‌های فشرده و ضعیف (زیر 4B)اجرای بدون محدودیت سنگین‌ترین مدل‌ها (حتی 70B)
میزان فشار به سخت‌افزار دسکتاپمصرف ۱۰۰ درصدی رم، داغ شدن شدید لپ‌تاپصفر! بار پردازش کاملاً روی سرور است
هزینه راه‌اندازی اولیهخرید کارت گرافیک گران‌قیمت (چند صد میلیون تومان)پرداخت اشتراکی ناچیز فقط به‌میزان دقایق استفاده

شرکت یارانش ابری فردوسی این چالش سخت‌افزاری را با فراهم کردن دسترسی به قوی‌ترین شتاب‌دهنده‌های گرافیکی دنیا حل کرده است. شما می‌توانید بدون درگیری با گلوگاه‌های سخت‌افزاری ویندوز، از بهترین سرور هوش مصنوعی ابر فردوسی استفاده کنید. با این راهکار، قوی‌ترین GPUها با چند کلیک تحت اختیار شما است تا هر مدلی را با نهایت سرعت اجرا کنید.

برای اینکه این فرایند ابری را بدون هیچ ریسک مالی تست کنید، ابر فردوسی ۱۰۰ هزار تومان اعتبار رایگان اولیه در کیف پول شما شارژ می‌کند. این یعنی می‌توانید همین حالا سرور خود را بسازید، مدل‌های بزرگ را روی آن بالا بیاورید و بازدهی پردازش ابری را کاملاً رایگان با سیستم خود مقایسه کنید.

سرور هوش مصنوعی

جمع‌بندی

ابزار اولاما فرایند مدیریت و استفاده از هوش مصنوعی محلی را از یک کار فرسایشی، به تجربه‌ای به‌شدت روان و لذت‌بخش تبدیل می‌کند. در این راهنما یاد گرفتیم که پیش‌نیازهای اصلی برای نصب Ollama روی ویندوز چیست، چطور متغیرهای سیستمی را تنظیم کنیم تا درایو ویندوزمان منفجر نشود، چطور با دستورات سه‌سوته ترمینال مدل‌ها را فرابخوانیم و در نهایت چطور لایه‌های خطا و تحریم شبکه را دور بزنیم. اما به‌عنوان نکته آخر یادتان باشد: فضای لوکال خوب است، به‌شرطی‌که پروژه شما به بن‌بست سخت‌افزاری نخورد. هرجا حس کردید سرعت Token per Second سیستم‌تان کلافه‌کننده شده، سرورهای ابر فردوسی همیشه برای شما باز هستند.

حالا شما برای ما بنویسید؛ اولاما را نصب کردید؟ بعداز نصب ک‍دام مدل زبانی را روی ترمینال بالا آوردید و سرعت پاسخ‌دهی دسکتاپ‌تان چطور بود؟ اگر در هر کدام از مراحل نصب یا تنظیم پورت با ارور خاصی مواجه شدید، در بخش نظرات بپرسید تا باهم برطرفش کنیم.

منابع:
مستندات ویندوز Ollama | مستندات CLI رسمی | troubleshootingهای مرتبط با ویندوز

سؤالات متداول

چگونه Ollama را در ویندوز نصب کنیم؟

فرایند نصب بسیار ساده است؛ ابتدا فایل نصبی OllamaSetup.exe را از سایت رسمی (یا لینک‌های کمکی داخلی) دانلود کنید. سپس روی فایل کلیک و گزینه Install را بزنید. نرم‌افزار در عرض چند ثانیه به‌صورت یک سرویس پس‌زمینه مستقر می‌شود و نشان لاما کنار ساعت ویندوز ظاهر خواهد شد. در نهایت با باز کردن پاورشل و زدن دستور ollama run llama3 اولین مدل شما فراخوانی می‌شود.

آیا Ollama روی ویندوز 10 و 11 اجرا می‌شود؟

بله به‌صورت بومی برای ویندوز 10 (نسخه 22H2 به بالا) و ویندوز 11 معماری ۶۴ بیتی توسعه یافته است. روی نسخه‌های قدیمی‌تر و نوستالژیک ویندوز مانند ویندوز 7 یا 8 به‌دلیل عدم پشتیبانی از درایورهای مدرن پردازشی و هسته‌های جدید سیستم‌عامل، امکان نصب و اجرای پایدار وجود ندارد.

اگر کارت گرافیک (GPU) نداشته باشیم، اولاما کار می‌کند؟

بله اگر سیستم شما فاقد کارت گرافیک مجزا باشد، به‌صورت کاملاً خودکار روی حالت CPU سوییچ می‌کند تا بتوانید مدل‌ها را اجرا کنید. اما حواستان باشد که سرعت تولید متون و پاسخ‌دهی درحالت CPU افت خواهد کرد و فقط برای مدل‌های بسیار سبک (زیر ۳ میلیارد پارامتر) کاربردی است.

آیا اولاما بدون اینترنت هم کار می‌کند؟

دقیقاً مزیت اصلی و فلسفه وجودی این ابزار همین است! شما فقط برای یک‌بار دانلود خود نرم‌افزار و فایل مدل‌های زبانی به اینترنت نیاز دارید. پس‌از اینکه دانلود لایه‌های مدل تمام شد، می‌توانید کابل شبکه را بکشید و کاملاً آفلاین، بدون دغدغه قطع اینترنت یا نشت داده‌ها به سرورهای خارجی با هوش مصنوعی دسکتاپ خود چت کنید.

چطور محل ذخیره فایل مدل‌ها را از درایو C تغییر دهیم؟

از آنجا که خود برنامه دکمه‌ای برای تغییر مسیر ندارد، باید از سیستم متغیرهای ویندوز کمک بگیرید. منوی استارت را باز کنید، وارد Environment Variables شوید و در بخش System Variables یک متغیر جدید با نام OLLAMA_MODELS بسازید. مقدار این متغیر را آدرس پوشه جدید در یک درایو خلوت و سریع (مثل D:\OllamaModels) بگذارید، برنامه را یک‌بار Quit کرده و دوباره باز کنید.

آیا می‌توان از Ollama به‌صورت API در برنامه‌های دیگر استفاده کرد؟

بله، اولاما بعد از اجرا یک وب‌سرور محلی روی پورت 11434 می‌سازد. شما می‌توانید با ارسال درخواست‌های استاندارد REST API به آدرس http://localhost:11434 کدهای پایتون، پکیج‌های LangChain یا رابط‌های گرافیکی پیشرفته‌ای مثل Open WebUI را به‌راحتی به دسکتاپ خود متصل کنید.

یاسین اسدی

اگه می‌خوای زندگیت تغیر کنه کتاب نخون؛ نوشته‌های منو بخون!
پست های مرتبط

آموزش کامل اجرای محلی Llama 3.1: راهنمای گام‌به‌گام هوش مصنوعی آفلاین لاما

احتمالاً برای شما هم پیش آمده که بخواهید داده‌های مهم پروژه‌تان را به یک هوش مصنوعی بسپارید، اما نگرانی از نقض حریم خصوصی یا محدودیت‌های تحریم و قطع‌شدن APIها شما را منصرف کرده باشد. اما باید خوشحال…

سیستم مورد نیاز هوش مصنوعی لوکال

حداقل سیستم مورد نیاز هوش مصنوعی برای اجرا به‌صورت لوکال به نوع و اندازه مدل هوش مصنوعی بستگی دارد. برای اجرای مدل‌های زبان کوچک (مانند نسخه‌های اولیه LLaMA) ممکن است ۱۶ گیگابایت رم هم کافی باشد، اما…

۱۹ اردیبهشت ۱۴۰۵

هوش مصنوعی آفلاین: معرفی بهترین ابزارهای AI بدون اینترنت

هوش مصنوعی آفلاین (Offline AI یا Local AI) به شما امکان می‌دهد تا مدل‌های زبانی و پردازشی را مستقیماً روی سخت‌افزار سیستم خود و بدون نیاز به اتصال اینترنت اجرا کنید. با نصب برنامه‌های هوش مصنوعی بدون…

۱۹ اردیبهشت ۱۴۰۵
0 0 رای ها
به مقاله امتیاز بدید
0 نظرات