مدل LFM2.5 لیکوئید ای‌آی که کاملاً روی دستگاه اجرا می‌شود

LFM2.5-2.6B؛ مدل هوش مصنوعی که کامل روی گوشی شما اجرا می‌شود

اخبار · هوش مصنوعی

استارتاپ Liquid AI مدلی معرفی کرده که ادعا می‌کند بدون هیچ اتصالی به اینترنت، روی گوشی و لپ‌تاپ شما اجرا می‌شود و در کار با ابزارها از مدل‌هایی چند برابر بزرگ‌تر جلو می‌زند. نام آن LFM2.5-2.6B است و تنها ۲.۶ میلیارد پارامتر دارد. این خبر بیش از آنکه درباره‌ی یک مدل باشد، درباره‌ی جابه‌جایی مرکز ثقل هوش مصنوعی از دیتاسنتر به دستگاه شخصی شماست.

چکیده. Liquid AI مدل ایجنتیک LFM2.5-2.6B را منتشر کرد؛ مدلی که کامل روی دستگاه اجرا می‌شود، در تست ToolSandbox از یک مدل ۹ میلیاردی جلو زده، روی تراشه‌ی اپل M5 Max به سرعت ۲۲۰ توکن در ثانیه می‌رسد و کمتر از ۲.۵ گیگابایت حافظه می‌خواهد. در ادامه می‌خوانید این عددها دقیقاً چه معنایی دارند، هوش مصنوعی روی‌دستگاه چه مزیت‌هایی در حریم خصوصی، تأخیر و هزینه دارد، چه محدودیت‌هایی را باید جدی بگیرید و از کجا می‌توانید چنین مدل‌هایی را روی سخت‌افزار خودتان اجرا کنید.
مدل LFM2.5 لیکوئید ای‌آی که کاملاً روی دستگاه اجرا می‌شود

۱) چه اتفاقی افتاد؟

استارتاپ Liquid AI از مدل تازه‌ای به نام LFM2.5-2.6B رونمایی کرده است؛ مدلی که برخلاف بیشتر نام‌های آشنای این حوزه، اساساً برای اجرا در دیتاسنتر ساخته نشده. این مدل «ایجنتیک» توصیف می‌شود، یعنی می‌تواند برنامه‌ریزی کند، ابزار صدا بزند و یک کار چندمرحله‌ای را تا انتها پیش ببرد؛ اما همه‌ی این کارها را روی خودِ دستگاه انجام می‌دهد: گوشی، لپ‌تاپ، کامپیوتر شخصی و حتی ربات.

مهم‌ترین جمله‌ی این معرفی یک ادعای ساده است: داده هیچ‌وقت از دستگاه خارج نمی‌شود و هزینه‌ی نهایی هر بار اجرا عملاً صفر است. طبق گزارش‌ها این مدل روی حدود ۳۴ تریلیون توکن پیش‌آموزش دیده و از روز نخست روی زیرساخت‌های متن‌باز رایجی مثل llama.cpp، MLX، vLLM، SGLang و ONNX پشتیبانی می‌شود. وزن‌های مدل هم روی Hugging Face در دسترس قرار گرفته است. اگر سال‌ها با نام‌هایی مثل اوپن‌ای‌آی و مدل‌های ابری‌اش این حوزه را دنبال کرده‌اید، این خبر یک مسیر کاملاً متفاوت را نشان می‌دهد.

۲) اعداد کلیدی؛ کوچک اما پرزور

چهار عددی که باید از این خبر به یاد بسپارید:

  • ۲.۶ میلیارد پارامتر: در مقیاس امروزی، این یعنی یک مدل بسیار کوچک. با همین اندازه، در تست ابزارها (ToolSandbox) از مدل ۹ میلیاردی Qwen3.5 هم جلو زده است.
  • ۲۲۰ توکن در ثانیه: سرعت تولید خروجی روی تراشه‌ی اپل M5 Max. این سرعت از سرعت خواندن یک انسان بسیار بیشتر است.
  • کمتر از ۲.۵ گیگابایت حافظه: یعنی جا شدن در بودجه‌ی رم یک گوشی یا لپ‌تاپ معمولی، نه یک کارت گرافیک حرفه‌ای.
  • هزینه‌ی نزدیک به صفر: وقتی محاسبات روی سخت‌افزار خودتان انجام می‌شود، صورت‌حساب ماهانه‌ی توکن حذف می‌شود.

ترکیب این چهار عدد است که خبر را جالب می‌کند. یک مدل کوچک و سریع، اگر بی‌دقت باشد، فقط یک اسباب‌بازی است؛ اما مدلی که هم کوچک است و هم در کار با ابزارها از رقیبان بزرگ‌تر جلو می‌زند، می‌تواند پایه‌ی محصولات واقعی باشد.

۳) ToolSandbox چیست و چرا این مقایسه مهم است؟

بیشتر بنچمارک‌های آشنا، دانش عمومی یا توان استدلال مدل را می‌سنجند. ToolSandbox چیز دیگری را اندازه می‌گیرد: اینکه مدل چقدر خوب می‌تواند «ابزار» صدا بزند. یعنی وقتی برای انجام یک کار باید تابعی را فراخوانی کند، ورودی درستی بسازد، خروجی را بخواند و بر اساس آن قدم بعدی را تصمیم بگیرد، چقدر قابل‌اعتماد است.

این دقیقاً همان مهارتی است که یک ایجنت به آن نیاز دارد. مدلی که متن قشنگ می‌نویسد اما در فراخوانی ابزار اشتباه می‌کند، برای اتوماسیون بی‌فایده است. جلو زدن یک مدل ۲.۶ میلیاردی از یک مدل ۹ میلیاردی در همین آزمون یعنی Liquid AI ظرفیت محدود مدل را به‌جای پخش‌کردن روی همه‌چیز، روی یک مهارت مشخص متمرکز کرده است. این همان منطق «تخصص به‌جای عمومیت» است که در مدل‌های کوچک بیش از پیش دیده می‌شود.

۴) «روی‌دستگاه» دقیقاً یعنی چه؟

در حالت آشنا، وقتی چیزی در یک دستیار هوش مصنوعی می‌نویسید، متن شما به سرور شرکت سازنده می‌رود، آنجا پردازش می‌شود و پاسخ برمی‌گردد. در حالت روی‌دستگاه (on-device)، کل این چرخه داخل خودِ گوشی یا لپ‌تاپ اتفاق می‌افتد. فایل مدل روی حافظه‌ی دستگاه ذخیره شده و پردازنده یا تراشه‌ی گرافیکی همان دستگاه محاسبات را انجام می‌دهد.

پیامد این تفاوت ساده، سه چیز است که در ادامه جداگانه بررسی می‌کنیم: حریم خصوصی، تأخیر و هزینه. اما یک پیامد چهارم هم دارد که کمتر درباره‌اش حرف زده می‌شود: استقلال. مدلی که روی دستگاه شماست، با تغییر سیاست قیمت‌گذاری یک شرکت، با قطعی سرویس یا با تحریم منطقه‌ای از کار نمی‌افتد.

عملکرد مدل ۲.۶ میلیارد پارامتری در برابر مدل‌های ۹ میلیاردی

۵) مزیت اول: حریم خصوصی که واقعاً معنا دارد

بند «داده‌های شما را نگه نمی‌داریم» در شرایط استفاده‌ی سرویس‌های ابری، در نهایت یک وعده است. در مدل روی‌دستگاه، این وعده به یک واقعیت فنی تبدیل می‌شود: داده جایی نمی‌رود چون اصلاً بسته‌ای از دستگاه خارج نمی‌شود.

این تفاوت برای بعضی کاربردها تعیین‌کننده است. پرونده‌ی پزشکی، قرارداد حقوقی، صورت‌های مالی داخلی، کد اختصاصی یک شرکت، مکالمات شخصی؛ در همه‌ی این موارد بسیاری از سازمان‌ها اصلاً اجازه‌ی ارسال داده به سرویس بیرونی را ندارند. تا امروز پاسخ به این محدودیت «پس هوش مصنوعی نه» بود. با مدل‌های کوچکِ توانمند، پاسخ می‌تواند «هوش مصنوعی، ولی محلی» باشد. اگر می‌خواهید بدانید این تغییر چه دری را برای سازمان‌ها باز می‌کند، بحث اهمیت هوش مصنوعی برای کسب‌وکار را از این زاویه دوباره بخوانید.

۶) مزیت دوم و سوم: تأخیر و هزینه

تأخیر. در سرویس ابری، بخشی از زمان پاسخ صرف رفت‌وبرگشت شبکه می‌شود. این چند صد میلی‌ثانیه در یک چت معمولی به چشم نمی‌آید، اما در ایجنتی که برای انجام یک کار ده بار ابزار صدا می‌زند، ده برابر می‌شود. در دستیار صوتی، در ترجمه‌ی هم‌زمان یا در رباتی که باید به محیط واکنش نشان دهد، همین تأخیر مرز بین «کار می‌کند» و «به درد نمی‌خورد» است. مدل محلی این هزینه‌ی شبکه را به صفر می‌رساند و در جای بدون اینترنت هم کار می‌کند.

هزینه. اقتصاد سرویس‌های ابری بر پایه‌ی توکن است: هرچه کاربران بیشتر و کارها طولانی‌تر شوند، صورت‌حساب بزرگ‌تر می‌شود. این دقیقاً همان نقطه‌ای است که خیلی از ایده‌های ایجنتی در آن شکست می‌خورند؛ محصول کار می‌کند اما در مقیاس، حاشیه‌ی سود را می‌بلعد. وقتی مدل روی دستگاه کاربر اجرا می‌شود، هزینه‌ی متغیر تقریباً حذف می‌شود و فقط هزینه‌ی ثابت توسعه می‌ماند. برای یک استارتاپ کوچک، این تفاوت می‌تواند تفاوت بین امکان‌پذیر و ناممکن باشد.

۷) چطور می‌توان مدل‌های روی‌دستگاه را اجرا کرد؟

خبر خوب این است که اجرای مدل محلی دیگر کار متخصص‌ها نیست. مسیر کلی به این شکل است:

  • انتخاب مدل: وزن‌های مدل‌های باز، از جمله LFM2.5-2.6B، معمولاً روی Hugging Face منتشر می‌شوند. اندازه‌ی مدل را با رم دستگاهتان بسنجید؛ قاعده‌ی سرانگشتی این است که مدل باید کمی کمتر از رم آزادتان جا بگیرد.
  • انتخاب موتور اجرا: llama.cpp رایج‌ترین گزینه برای اجرای مدل روی پردازنده و کارت گرافیک خانگی است. روی مک، MLX از تراشه‌های اپل بهره می‌برد. برای اجرای سمت سرور، vLLM و SGLang و برای بستر‌های متنوع‌تر ONNX استفاده می‌شود. LFM2.5-2.6B از روز اول همه‌ی این‌ها را پشتیبانی می‌کند.
  • رابط کاربری ساده: اگر با خط فرمان راحت نیستید، برنامه‌های دسکتاپی وجود دارند که مدل را دانلود و با یک پنجره‌ی چت اجرا می‌کنند. عملاً چند کلیک تا اولین پاسخ محلی فاصله دارید.
  • کوانتیزه‌کردن: نسخه‌های فشرده‌شده‌ی مدل (مثلاً ۴ بیتی) حافظه‌ی کمتری می‌خواهند و سریع‌تر اجرا می‌شوند، به قیمت افت کمی در کیفیت. برای بیشتر کاربردهای روزمره این معامله به‌صرفه است.

یک نکته‌ی مهم: مدل کوچک به پرامپت دقیق‌تر حساس‌تر است. جایی که یک مدل غول‌پیکر منظور مبهم شما را حدس می‌زند، مدل ۲.۶ میلیاردی ممکن است بیراهه برود. برای همین، مرور اصول پرامپت‌نویسی پیش از کار با مدل‌های محلی، بازدهی شما را به شکل محسوسی بالا می‌برد.

۸) چه کارهایی را خوب انجام می‌دهند و چه کارهایی را نه

واقع‌بین باشیم. یک مدل ۲.۶ میلیاردی جایگزین بزرگ‌ترین مدل‌های ابری نمی‌شود و سازنده هم چنین ادعایی نکرده است. آنچه این کلاس از مدل‌ها خوب انجام می‌دهند:

  • دسته‌بندی، برچسب‌زنی و استخراج اطلاعات ساختاریافته از متن
  • خلاصه‌سازی و بازنویسی متن‌های کوتاه تا متوسط
  • فراخوانی ابزار و مسیریابی درخواست کاربر به تابع درست
  • دستیارهای درون‌برنامه‌ای که باید سریع و آفلاین باشند

و آنچه باید انتظارش را نداشته باشید: استدلال‌های طولانی و چندلایه، دانش دایرة‌المعارفی دقیق، نوشتن معماری کامل یک نرم‌افزار، یا کارهایی که به زمینه‌ی بسیار بلند نیاز دارند. اینجا همان جایی است که بحث پتانسیل واقعی و محدودیت‌های هوش مصنوعی اهمیت پیدا می‌کند؛ و همان جایی که توهم جایگزینی مهندس واقعی با یک ابزار هوشمند شکل می‌گیرد. ابزار کوچک و سریع، مکمل است نه جانشین.

مزیت حریم خصوصی مدل‌های روی‌دستگاه چون داده از گوشی خارج نمی‌شود

۹) تصویر بزرگ‌تر: لبه در کنار کلاود، نه در برابر آن

اگر روند دو سال گذشته را کنار هم بگذارید، الگو روشن است: از یک طرف مدل‌های ابری بزرگ‌تر و گران‌تر می‌شوند، از طرف دیگر مدل‌های کوچک با سرعتی عجیب توانمندتر می‌شوند. نتیجه‌ی محتمل، یک معماری ترکیبی است؛ مدل محلی کارهای پرتکرار، حساس و فوری را انجام می‌دهد و فقط کارهای سنگین را به مدل ابری واگذار می‌کند.

در این نگاه، خبر Liquid AI صرفاً یک محصول تازه نیست؛ نشانه‌ای است از اینکه لایه‌ی «لبه» دارد جدی می‌شود. اگر سازنده‌ی محصول هستید، ارزش دارد از همین حالا از خودتان بپرسید کدام بخش از کارهای مدلی که به کلاود می‌فرستید، واقعاً به کلاود نیاز دارد. برای دنبال‌کردن ادامه‌ی این رقابت، بخش اخبار هوش مصنوعی را زیر نظر داشته باشید.

پرسش‌های پرتکرار درباره‌ی مدل‌های هوش مصنوعی روی‌دستگاه

آیا LFM2.5-2.6B واقعاً بدون اینترنت کار می‌کند؟

بله. کل ایده‌ی این مدل همین است؛ پس از دانلود اولیه‌ی فایل مدل، پردازش روی خودِ دستگاه انجام می‌شود و نیازی به اتصال شبکه نیست. البته اگر ایجنتی بسازید که ابزارهایش به اینترنت وصل باشند (مثلاً جست‌وجوی وب)، آن ابزارها همچنان به شبکه نیاز دارند؛ اما خودِ مدل نه.

برای اجرای چنین مدلی چه سخت‌افزاری لازم است؟

طبق اعلام سازنده، این مدل با کمتر از ۲.۵ گیگابایت حافظه اجرا می‌شود. یعنی گوشی‌ها و لپ‌تاپ‌های میان‌رده‌ی امروزی از پس آن برمی‌آیند. سرعت اعلام‌شده‌ی ۲۲۰ توکن در ثانیه مربوط به تراشه‌ی اپل M5 Max است و روی سخت‌افزار ضعیف‌تر طبیعتاً کمتر خواهد بود، اما همچنان برای کاربردهای تعاملی قابل قبول است.

آیا این مدل جای چت‌جی‌پی‌تی را می‌گیرد؟

خیر. کاربرد این مدل، دستیارهای سریع، ایجنت‌های سبک و پردازش‌های حساس به حریم خصوصی است، نه رقابت با بزرگ‌ترین مدل‌های ابری در استدلال‌های پیچیده. مقایسه‌ی درست‌تر، مقایسه با دیگر مدل‌های کوچک است؛ همان‌طور که در مقایسه‌های مدل‌به‌مدل هم می‌بینیم، هر مدل برای یک کلاس از کارها ساخته شده است.

هزینه‌ی استفاده از مدل روی‌دستگاه چقدر است؟

هزینه‌ی متغیر آن تقریباً صفر است، چون توکنی به سروری فروخته نمی‌شود. آنچه می‌پردازید، مصرف باتری و منابع دستگاه است، به‌علاوه‌ی زمانی که برای راه‌اندازی و بهینه‌سازی صرف می‌کنید. برای محصولاتی با تعداد کاربر بالا، همین حذف هزینه‌ی متغیر می‌تواند مدل کسب‌وکار را از پایه تغییر دهد.

مدل «ایجنتیک» یعنی چه؟

یعنی مدلی که فقط پاسخ متنی نمی‌دهد، بلکه می‌تواند برای رسیدن به یک هدف برنامه بریزد، ابزارها و توابع بیرونی را صدا بزند، نتیجه را ارزیابی کند و قدم بعدی را انتخاب کند. همین توانایی است که با تست‌هایی مثل ToolSandbox سنجیده می‌شود و LFM2.5-2.6B روی آن تمرکز کرده است.

جمع‌بندی. LFM2.5-2.6B نشان می‌دهد که مدل‌های کوچک دیگر نسخه‌ی ضعیف‌شده‌ی مدل‌های بزرگ نیستند، بلکه ابزارهایی هستند که برای یک کار مشخص بهینه شده‌اند و همان کار را روی دستگاه شما، بدون اینترنت و بدون هزینه‌ی مداوم، انجام می‌دهند. اگر می‌خواهید ادامه‌ی این تحول و خبرهای تازه‌ی هوش مصنوعی را زودتر از بقیه ببینید، کانال تلگرام @MrChatGPT_IR را دنبال کنید.
— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *