Ollama در ده دقیقه؛ اولین مدل محلی شما

⏱ زمان مطالعه: حدود ۵ دقیقه

اگر تا امروز هرگز یک مدل زبانی را روی سیستم خودتان اجرا نکرده‌اید، Ollama احتمالاً ساده‌ترین نقطهٔ شروع است. این ابزار جزئیات پیچیدهٔ دانلود وزن‌های مدل، تنظیم محیط اجرا و مدیریت حافظه را از شما پنهان می‌کند و همه‌چیز را به چند دستور ساده در ترمینال تبدیل می‌کند. در این راهنما، در کمتر از ده دقیقهٔ واقعی کار، Ollama را نصب می‌کنیم، اولین مدل را دانلود می‌کنیم و با آن گفت‌وگو می‌کنیم.

Ollama چیست و چرا نقطهٔ شروع خوبی است

Ollama یک برنامهٔ سبک است که مدل‌های زبانی متن‌باز را دانلود، مدیریت و اجرا می‌کند، و یک رابط خط‌فرمان ساده به همراه یک سرور API محلی در اختیار شما می‌گذارد. برخلاف نصب دستی کتابخانه‌های یادگیری ماشین، Ollama خودش نسخهٔ مناسب هر مدل را برای سخت‌افزار شما انتخاب می‌کند و نیازی به دانستن جزئیات فنی کوانتیزیشن یا فرمت فایل مدل ندارید. همین سادگی، آن را برای اولین تجربهٔ اجرای محلی مناسب می‌کند.

Ollama در ده دقیقه؛ اولین مدل محلی شما

نصب روی سیستم‌عامل‌های مختلف

روی macOS و لینوکس، نصب با یک دستور در ترمینال انجام می‌شود:

curl -fsSL https://ollama.com/install.sh | sh

روی macOS همچنین می‌توانید نسخهٔ برنامهٔ گرافیکی را از سایت ollama.com دانلود و مثل هر برنامهٔ دیگری نصب کنید. روی ویندوز، فایل نصب‌کنندهٔ رسمی را از همان سایت دانلود کرده و اجرا می‌کنید؛ Ollama در پس‌زمینه به‌عنوان یک سرویس بالا می‌آید و نیازی به تنظیم دستی ندارد.

دانلود و اجرای اولین مدل

پس از نصب، برای دانلود و اجرای همزمان یک مدل کافی است این دستور را در ترمینال بزنید:

ollama run llama3

اگر مدل قبلاً دانلود نشده باشد، Ollama ابتدا آن را می‌گیرد و سپس یک محیط گفت‌وگوی تعاملی در همان ترمینال باز می‌کند. برای دانلود یک مدل بدون اجرای فوری آن، از دستور جداگانه استفاده کنید؛ این روش برای زمانی مفید است که می‌خواهید چند مدل را از قبل آماده کنید:

ollama pull llama3:8b

عدد بعد از دو نقطه، نسخهٔ مشخصی از مدل را تعیین می‌کند. اگر سخت‌افزار شما محدود است (مثلاً یک لپ‌تاپ معمولی بدون کارت گرافیک قوی)، بهتر است با کوچک‌ترین نسخهٔ موجود از یک مدل شروع کنید تا سرعت اجرا قابل‌قبول بماند.

گفت‌وگو با مدل در ترمینال

بعد از اجرای دستور run، می‌توانید مستقیم پیام خود را تایپ کنید و پاسخ مدل را در همان پنجرهٔ ترمینال ببینید. برای خروج از این محیط گفت‌وگو، کافی است دستور زیر را تایپ کنید یا از میان‌بر خروج ترمینال استفاده کنید:

/bye

برای دیدن فهرست مدل‌هایی که تا الان دانلود کرده‌اید:

ollama list

و برای حذف یک مدل و آزاد کردن فضای دیسک:

ollama rm llama3:8b

استفاده از Ollama به‌عنوان یک API محلی

یکی از قابلیت‌های مهم Ollama این است که همزمان با نصب، یک سرور HTTP محلی هم راه می‌اندازد که روی پورت ۱۱۴۳۴ در دسترس است. این یعنی می‌توانید از هر برنامه یا اسکریپتی، دقیقاً مثل یک API خارجی، به مدل محلی خودتان درخواست بفرستید:

curl http://localhost:11434/api/generate -d '{"model": "llama3", "prompt": "چند جمله دربارهٔ ایران بنویس"}'

این ویژگی همان چیزی است که مدل محلی را از یک اسباب‌بازی ترمینالی به یک جزء واقعی در معماری یک اپلیکیشن تبدیل می‌کند؛ می‌توانید بک‌اند خودتان را طوری بنویسید که به‌جای فراخوانی یک سرویس بیرونی، به همین آدرس محلی وصل شود.

نکتهٔ مهم دربارهٔ این سرور محلی این است که پیش‌فرض فقط از خود همان سیستم قابل‌دسترسی است. اگر می‌خواهید از یک دستگاه دیگر در همان شبکه به آن وصل شوید، باید متغیر محیطی مربوط به آدرس گوش‌دادن سرویس را تغییر دهید و دوبارهٔ سرویس را راه‌اندازی کنید. برای اغلب کاربردهای توسعه و تست روی همان سیستم، تنظیمات پیش‌فرض کاملاً کافی است و نیازی به این تغییر نیست.

انتخاب مدل مناسب برای سخت‌افزار خودتان

یکی از رایج‌ترین مشکلات کاربران تازه‌کار، دانلود مستقیم بزرگ‌ترین نسخهٔ یک مدل بدون توجه به حافظهٔ سیستم است؛ نتیجه معمولاً اجرای بسیار کند یا خطای کمبود حافظه است. Ollama صفحه‌ای در سایت خودش دارد که کنار هر مدل، اندازه‌های مختلف آن را فهرست می‌کند. قاعدهٔ کلی این است که با کوچک‌ترین نسخهٔ یک خانوادهٔ مدل شروع کنید، ببینید سرعت پاسخ‌دهی برای شما قابل‌قبول است یا نه، و فقط در صورت نیاز واقعی سراغ نسخهٔ بزرگ‌تر بروید. اگر سیستم شما کارت گرافیک اختصاصی ندارد، Ollama به‌صورت خودکار روی پردازندهٔ مرکزی اجرا می‌شود که کندتر است اما همچنان کار می‌کند؛ فقط انتظار سرعت مشابه یک API آنلاین را نداشته باشید.

وقتی چیزی کار نمی‌کند

اگر بعد از نصب دستور ollama run پاسخ نمی‌دهد، ابتدا مطمئن شوید سرویس Ollama در پس‌زمینه در حال اجراست؛ روی مک و ویندوز این معمولاً به‌صورت خودکار انجام می‌شود، ولی روی لینوکس گاهی لازم است سرویس را به‌صورت دستی استارت کنید. اگر مدل بسیار کند اجرا می‌شود، احتمالاً حافظهٔ سیستم شما برای آن نسخه کافی نیست؛ در این حالت به سراغ نسخهٔ کوچک‌تر همان مدل بروید. خطاهای مربوط به فضای دیسک هم رایج‌اند، چون مدل‌های زبانی حتی در کوچک‌ترین نسخه‌ها چند گیگابایت حجم دارند؛ پیش از دانلود، فضای خالی دیسک را بررسی کنید.

جدول دستورات پرکاربرد

دستور کاربرد
ollama run <model> دانلود در صورت نیاز و شروع گفت‌وگوی تعاملی
ollama pull <model> فقط دانلود مدل بدون اجرا
ollama list نمایش مدل‌های دانلودشده
ollama rm <model> حذف یک مدل از دیسک
ollama ps نمایش مدل‌هایی که هم‌اکنون در حافظه بارگذاری شده‌اند

پس از این تجربهٔ اول، اگر می‌خواهید بدانید کدام مدل برای وظیفهٔ خاص شما مناسب‌تر است یا چطور مسیر یادگیری را ادامه دهید، نقشهٔ راه مدل‌های متن‌باز و اجرای محلی ادامهٔ منطقی این راهنماست.

جمع‌بندی

  • نصب Ollama روی مک و لینوکس فقط یک دستور ترمینال است؛ روی ویندوز یک نصب‌کنندهٔ گرافیکی دارد.
  • دستور ollama run هم دانلود می‌کند هم گفت‌وگوی تعاملی را شروع می‌کند.
  • برای سخت‌افزار محدود، از کوچک‌ترین نسخهٔ موجود مدل شروع کنید.
  • Ollama یک سرور API محلی هم راه می‌اندازد که می‌توانید از هر برنامه‌ای به آن وصل شوید.
  • دستورات list، rm و ps برای مدیریت روزمرهٔ مدل‌های دانلودشده کافی‌اند.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *