اگر تا امروز هرگز یک مدل زبانی را روی سیستم خودتان اجرا نکردهاید، Ollama احتمالاً سادهترین نقطهٔ شروع است. این ابزار جزئیات پیچیدهٔ دانلود وزنهای مدل، تنظیم محیط اجرا و مدیریت حافظه را از شما پنهان میکند و همهچیز را به چند دستور ساده در ترمینال تبدیل میکند. در این راهنما، در کمتر از ده دقیقهٔ واقعی کار، Ollama را نصب میکنیم، اولین مدل را دانلود میکنیم و با آن گفتوگو میکنیم.
لیست مطالب
Ollama چیست و چرا نقطهٔ شروع خوبی است
Ollama یک برنامهٔ سبک است که مدلهای زبانی متنباز را دانلود، مدیریت و اجرا میکند، و یک رابط خطفرمان ساده به همراه یک سرور API محلی در اختیار شما میگذارد. برخلاف نصب دستی کتابخانههای یادگیری ماشین، Ollama خودش نسخهٔ مناسب هر مدل را برای سختافزار شما انتخاب میکند و نیازی به دانستن جزئیات فنی کوانتیزیشن یا فرمت فایل مدل ندارید. همین سادگی، آن را برای اولین تجربهٔ اجرای محلی مناسب میکند.

نصب روی سیستمعاملهای مختلف
روی macOS و لینوکس، نصب با یک دستور در ترمینال انجام میشود:
curl -fsSL https://ollama.com/install.sh | sh
روی macOS همچنین میتوانید نسخهٔ برنامهٔ گرافیکی را از سایت ollama.com دانلود و مثل هر برنامهٔ دیگری نصب کنید. روی ویندوز، فایل نصبکنندهٔ رسمی را از همان سایت دانلود کرده و اجرا میکنید؛ Ollama در پسزمینه بهعنوان یک سرویس بالا میآید و نیازی به تنظیم دستی ندارد.
دانلود و اجرای اولین مدل
پس از نصب، برای دانلود و اجرای همزمان یک مدل کافی است این دستور را در ترمینال بزنید:
ollama run llama3
اگر مدل قبلاً دانلود نشده باشد، Ollama ابتدا آن را میگیرد و سپس یک محیط گفتوگوی تعاملی در همان ترمینال باز میکند. برای دانلود یک مدل بدون اجرای فوری آن، از دستور جداگانه استفاده کنید؛ این روش برای زمانی مفید است که میخواهید چند مدل را از قبل آماده کنید:
ollama pull llama3:8b
عدد بعد از دو نقطه، نسخهٔ مشخصی از مدل را تعیین میکند. اگر سختافزار شما محدود است (مثلاً یک لپتاپ معمولی بدون کارت گرافیک قوی)، بهتر است با کوچکترین نسخهٔ موجود از یک مدل شروع کنید تا سرعت اجرا قابلقبول بماند.
گفتوگو با مدل در ترمینال
بعد از اجرای دستور run، میتوانید مستقیم پیام خود را تایپ کنید و پاسخ مدل را در همان پنجرهٔ ترمینال ببینید. برای خروج از این محیط گفتوگو، کافی است دستور زیر را تایپ کنید یا از میانبر خروج ترمینال استفاده کنید:
/bye
برای دیدن فهرست مدلهایی که تا الان دانلود کردهاید:
ollama list
و برای حذف یک مدل و آزاد کردن فضای دیسک:
ollama rm llama3:8b
استفاده از Ollama بهعنوان یک API محلی
یکی از قابلیتهای مهم Ollama این است که همزمان با نصب، یک سرور HTTP محلی هم راه میاندازد که روی پورت ۱۱۴۳۴ در دسترس است. این یعنی میتوانید از هر برنامه یا اسکریپتی، دقیقاً مثل یک API خارجی، به مدل محلی خودتان درخواست بفرستید:
curl http://localhost:11434/api/generate -d '{"model": "llama3", "prompt": "چند جمله دربارهٔ ایران بنویس"}'
این ویژگی همان چیزی است که مدل محلی را از یک اسباببازی ترمینالی به یک جزء واقعی در معماری یک اپلیکیشن تبدیل میکند؛ میتوانید بکاند خودتان را طوری بنویسید که بهجای فراخوانی یک سرویس بیرونی، به همین آدرس محلی وصل شود.
نکتهٔ مهم دربارهٔ این سرور محلی این است که پیشفرض فقط از خود همان سیستم قابلدسترسی است. اگر میخواهید از یک دستگاه دیگر در همان شبکه به آن وصل شوید، باید متغیر محیطی مربوط به آدرس گوشدادن سرویس را تغییر دهید و دوبارهٔ سرویس را راهاندازی کنید. برای اغلب کاربردهای توسعه و تست روی همان سیستم، تنظیمات پیشفرض کاملاً کافی است و نیازی به این تغییر نیست.
انتخاب مدل مناسب برای سختافزار خودتان
یکی از رایجترین مشکلات کاربران تازهکار، دانلود مستقیم بزرگترین نسخهٔ یک مدل بدون توجه به حافظهٔ سیستم است؛ نتیجه معمولاً اجرای بسیار کند یا خطای کمبود حافظه است. Ollama صفحهای در سایت خودش دارد که کنار هر مدل، اندازههای مختلف آن را فهرست میکند. قاعدهٔ کلی این است که با کوچکترین نسخهٔ یک خانوادهٔ مدل شروع کنید، ببینید سرعت پاسخدهی برای شما قابلقبول است یا نه، و فقط در صورت نیاز واقعی سراغ نسخهٔ بزرگتر بروید. اگر سیستم شما کارت گرافیک اختصاصی ندارد، Ollama بهصورت خودکار روی پردازندهٔ مرکزی اجرا میشود که کندتر است اما همچنان کار میکند؛ فقط انتظار سرعت مشابه یک API آنلاین را نداشته باشید.
وقتی چیزی کار نمیکند
اگر بعد از نصب دستور ollama run پاسخ نمیدهد، ابتدا مطمئن شوید سرویس Ollama در پسزمینه در حال اجراست؛ روی مک و ویندوز این معمولاً بهصورت خودکار انجام میشود، ولی روی لینوکس گاهی لازم است سرویس را بهصورت دستی استارت کنید. اگر مدل بسیار کند اجرا میشود، احتمالاً حافظهٔ سیستم شما برای آن نسخه کافی نیست؛ در این حالت به سراغ نسخهٔ کوچکتر همان مدل بروید. خطاهای مربوط به فضای دیسک هم رایجاند، چون مدلهای زبانی حتی در کوچکترین نسخهها چند گیگابایت حجم دارند؛ پیش از دانلود، فضای خالی دیسک را بررسی کنید.
جدول دستورات پرکاربرد
| دستور | کاربرد |
|---|---|
| ollama run <model> | دانلود در صورت نیاز و شروع گفتوگوی تعاملی |
| ollama pull <model> | فقط دانلود مدل بدون اجرا |
| ollama list | نمایش مدلهای دانلودشده |
| ollama rm <model> | حذف یک مدل از دیسک |
| ollama ps | نمایش مدلهایی که هماکنون در حافظه بارگذاری شدهاند |
پس از این تجربهٔ اول، اگر میخواهید بدانید کدام مدل برای وظیفهٔ خاص شما مناسبتر است یا چطور مسیر یادگیری را ادامه دهید، نقشهٔ راه مدلهای متنباز و اجرای محلی ادامهٔ منطقی این راهنماست.
جمعبندی
- نصب Ollama روی مک و لینوکس فقط یک دستور ترمینال است؛ روی ویندوز یک نصبکنندهٔ گرافیکی دارد.
- دستور ollama run هم دانلود میکند هم گفتوگوی تعاملی را شروع میکند.
- برای سختافزار محدود، از کوچکترین نسخهٔ موجود مدل شروع کنید.
- Ollama یک سرور API محلی هم راه میاندازد که میتوانید از هر برنامهای به آن وصل شوید.
- دستورات list، rm و ps برای مدیریت روزمرهٔ مدلهای دانلودشده کافیاند.
