استارتاپ Liquid AI مدلی معرفی کرده که ادعا میکند بدون هیچ اتصالی به اینترنت، روی گوشی و لپتاپ شما اجرا میشود و در کار با ابزارها از مدلهایی چند برابر بزرگتر جلو میزند. نام آن LFM2.5-2.6B است و تنها ۲.۶ میلیارد پارامتر دارد. این خبر بیش از آنکه دربارهی یک مدل باشد، دربارهی جابهجایی مرکز ثقل هوش مصنوعی از دیتاسنتر به دستگاه شخصی شماست.

لیست مطالب
۱) چه اتفاقی افتاد؟
استارتاپ Liquid AI از مدل تازهای به نام LFM2.5-2.6B رونمایی کرده است؛ مدلی که برخلاف بیشتر نامهای آشنای این حوزه، اساساً برای اجرا در دیتاسنتر ساخته نشده. این مدل «ایجنتیک» توصیف میشود، یعنی میتواند برنامهریزی کند، ابزار صدا بزند و یک کار چندمرحلهای را تا انتها پیش ببرد؛ اما همهی این کارها را روی خودِ دستگاه انجام میدهد: گوشی، لپتاپ، کامپیوتر شخصی و حتی ربات.
مهمترین جملهی این معرفی یک ادعای ساده است: داده هیچوقت از دستگاه خارج نمیشود و هزینهی نهایی هر بار اجرا عملاً صفر است. طبق گزارشها این مدل روی حدود ۳۴ تریلیون توکن پیشآموزش دیده و از روز نخست روی زیرساختهای متنباز رایجی مثل llama.cpp، MLX، vLLM، SGLang و ONNX پشتیبانی میشود. وزنهای مدل هم روی Hugging Face در دسترس قرار گرفته است. اگر سالها با نامهایی مثل اوپنایآی و مدلهای ابریاش این حوزه را دنبال کردهاید، این خبر یک مسیر کاملاً متفاوت را نشان میدهد.
۲) اعداد کلیدی؛ کوچک اما پرزور
چهار عددی که باید از این خبر به یاد بسپارید:
- ۲.۶ میلیارد پارامتر: در مقیاس امروزی، این یعنی یک مدل بسیار کوچک. با همین اندازه، در تست ابزارها (ToolSandbox) از مدل ۹ میلیاردی Qwen3.5 هم جلو زده است.
- ۲۲۰ توکن در ثانیه: سرعت تولید خروجی روی تراشهی اپل M5 Max. این سرعت از سرعت خواندن یک انسان بسیار بیشتر است.
- کمتر از ۲.۵ گیگابایت حافظه: یعنی جا شدن در بودجهی رم یک گوشی یا لپتاپ معمولی، نه یک کارت گرافیک حرفهای.
- هزینهی نزدیک به صفر: وقتی محاسبات روی سختافزار خودتان انجام میشود، صورتحساب ماهانهی توکن حذف میشود.
ترکیب این چهار عدد است که خبر را جالب میکند. یک مدل کوچک و سریع، اگر بیدقت باشد، فقط یک اسباببازی است؛ اما مدلی که هم کوچک است و هم در کار با ابزارها از رقیبان بزرگتر جلو میزند، میتواند پایهی محصولات واقعی باشد.
۳) ToolSandbox چیست و چرا این مقایسه مهم است؟
بیشتر بنچمارکهای آشنا، دانش عمومی یا توان استدلال مدل را میسنجند. ToolSandbox چیز دیگری را اندازه میگیرد: اینکه مدل چقدر خوب میتواند «ابزار» صدا بزند. یعنی وقتی برای انجام یک کار باید تابعی را فراخوانی کند، ورودی درستی بسازد، خروجی را بخواند و بر اساس آن قدم بعدی را تصمیم بگیرد، چقدر قابلاعتماد است.
این دقیقاً همان مهارتی است که یک ایجنت به آن نیاز دارد. مدلی که متن قشنگ مینویسد اما در فراخوانی ابزار اشتباه میکند، برای اتوماسیون بیفایده است. جلو زدن یک مدل ۲.۶ میلیاردی از یک مدل ۹ میلیاردی در همین آزمون یعنی Liquid AI ظرفیت محدود مدل را بهجای پخشکردن روی همهچیز، روی یک مهارت مشخص متمرکز کرده است. این همان منطق «تخصص بهجای عمومیت» است که در مدلهای کوچک بیش از پیش دیده میشود.
۴) «رویدستگاه» دقیقاً یعنی چه؟
در حالت آشنا، وقتی چیزی در یک دستیار هوش مصنوعی مینویسید، متن شما به سرور شرکت سازنده میرود، آنجا پردازش میشود و پاسخ برمیگردد. در حالت رویدستگاه (on-device)، کل این چرخه داخل خودِ گوشی یا لپتاپ اتفاق میافتد. فایل مدل روی حافظهی دستگاه ذخیره شده و پردازنده یا تراشهی گرافیکی همان دستگاه محاسبات را انجام میدهد.
پیامد این تفاوت ساده، سه چیز است که در ادامه جداگانه بررسی میکنیم: حریم خصوصی، تأخیر و هزینه. اما یک پیامد چهارم هم دارد که کمتر دربارهاش حرف زده میشود: استقلال. مدلی که روی دستگاه شماست، با تغییر سیاست قیمتگذاری یک شرکت، با قطعی سرویس یا با تحریم منطقهای از کار نمیافتد.

۵) مزیت اول: حریم خصوصی که واقعاً معنا دارد
بند «دادههای شما را نگه نمیداریم» در شرایط استفادهی سرویسهای ابری، در نهایت یک وعده است. در مدل رویدستگاه، این وعده به یک واقعیت فنی تبدیل میشود: داده جایی نمیرود چون اصلاً بستهای از دستگاه خارج نمیشود.
این تفاوت برای بعضی کاربردها تعیینکننده است. پروندهی پزشکی، قرارداد حقوقی، صورتهای مالی داخلی، کد اختصاصی یک شرکت، مکالمات شخصی؛ در همهی این موارد بسیاری از سازمانها اصلاً اجازهی ارسال داده به سرویس بیرونی را ندارند. تا امروز پاسخ به این محدودیت «پس هوش مصنوعی نه» بود. با مدلهای کوچکِ توانمند، پاسخ میتواند «هوش مصنوعی، ولی محلی» باشد. اگر میخواهید بدانید این تغییر چه دری را برای سازمانها باز میکند، بحث اهمیت هوش مصنوعی برای کسبوکار را از این زاویه دوباره بخوانید.
۶) مزیت دوم و سوم: تأخیر و هزینه
تأخیر. در سرویس ابری، بخشی از زمان پاسخ صرف رفتوبرگشت شبکه میشود. این چند صد میلیثانیه در یک چت معمولی به چشم نمیآید، اما در ایجنتی که برای انجام یک کار ده بار ابزار صدا میزند، ده برابر میشود. در دستیار صوتی، در ترجمهی همزمان یا در رباتی که باید به محیط واکنش نشان دهد، همین تأخیر مرز بین «کار میکند» و «به درد نمیخورد» است. مدل محلی این هزینهی شبکه را به صفر میرساند و در جای بدون اینترنت هم کار میکند.
هزینه. اقتصاد سرویسهای ابری بر پایهی توکن است: هرچه کاربران بیشتر و کارها طولانیتر شوند، صورتحساب بزرگتر میشود. این دقیقاً همان نقطهای است که خیلی از ایدههای ایجنتی در آن شکست میخورند؛ محصول کار میکند اما در مقیاس، حاشیهی سود را میبلعد. وقتی مدل روی دستگاه کاربر اجرا میشود، هزینهی متغیر تقریباً حذف میشود و فقط هزینهی ثابت توسعه میماند. برای یک استارتاپ کوچک، این تفاوت میتواند تفاوت بین امکانپذیر و ناممکن باشد.
۷) چطور میتوان مدلهای رویدستگاه را اجرا کرد؟
خبر خوب این است که اجرای مدل محلی دیگر کار متخصصها نیست. مسیر کلی به این شکل است:
- انتخاب مدل: وزنهای مدلهای باز، از جمله LFM2.5-2.6B، معمولاً روی Hugging Face منتشر میشوند. اندازهی مدل را با رم دستگاهتان بسنجید؛ قاعدهی سرانگشتی این است که مدل باید کمی کمتر از رم آزادتان جا بگیرد.
- انتخاب موتور اجرا:
llama.cppرایجترین گزینه برای اجرای مدل روی پردازنده و کارت گرافیک خانگی است. روی مک،MLXاز تراشههای اپل بهره میبرد. برای اجرای سمت سرور،vLLMوSGLangو برای بسترهای متنوعترONNXاستفاده میشود. LFM2.5-2.6B از روز اول همهی اینها را پشتیبانی میکند. - رابط کاربری ساده: اگر با خط فرمان راحت نیستید، برنامههای دسکتاپی وجود دارند که مدل را دانلود و با یک پنجرهی چت اجرا میکنند. عملاً چند کلیک تا اولین پاسخ محلی فاصله دارید.
- کوانتیزهکردن: نسخههای فشردهشدهی مدل (مثلاً ۴ بیتی) حافظهی کمتری میخواهند و سریعتر اجرا میشوند، به قیمت افت کمی در کیفیت. برای بیشتر کاربردهای روزمره این معامله بهصرفه است.
یک نکتهی مهم: مدل کوچک به پرامپت دقیقتر حساستر است. جایی که یک مدل غولپیکر منظور مبهم شما را حدس میزند، مدل ۲.۶ میلیاردی ممکن است بیراهه برود. برای همین، مرور اصول پرامپتنویسی پیش از کار با مدلهای محلی، بازدهی شما را به شکل محسوسی بالا میبرد.
۸) چه کارهایی را خوب انجام میدهند و چه کارهایی را نه
واقعبین باشیم. یک مدل ۲.۶ میلیاردی جایگزین بزرگترین مدلهای ابری نمیشود و سازنده هم چنین ادعایی نکرده است. آنچه این کلاس از مدلها خوب انجام میدهند:
- دستهبندی، برچسبزنی و استخراج اطلاعات ساختاریافته از متن
- خلاصهسازی و بازنویسی متنهای کوتاه تا متوسط
- فراخوانی ابزار و مسیریابی درخواست کاربر به تابع درست
- دستیارهای درونبرنامهای که باید سریع و آفلاین باشند
و آنچه باید انتظارش را نداشته باشید: استدلالهای طولانی و چندلایه، دانش دایرةالمعارفی دقیق، نوشتن معماری کامل یک نرمافزار، یا کارهایی که به زمینهی بسیار بلند نیاز دارند. اینجا همان جایی است که بحث پتانسیل واقعی و محدودیتهای هوش مصنوعی اهمیت پیدا میکند؛ و همان جایی که توهم جایگزینی مهندس واقعی با یک ابزار هوشمند شکل میگیرد. ابزار کوچک و سریع، مکمل است نه جانشین.

۹) تصویر بزرگتر: لبه در کنار کلاود، نه در برابر آن
اگر روند دو سال گذشته را کنار هم بگذارید، الگو روشن است: از یک طرف مدلهای ابری بزرگتر و گرانتر میشوند، از طرف دیگر مدلهای کوچک با سرعتی عجیب توانمندتر میشوند. نتیجهی محتمل، یک معماری ترکیبی است؛ مدل محلی کارهای پرتکرار، حساس و فوری را انجام میدهد و فقط کارهای سنگین را به مدل ابری واگذار میکند.
در این نگاه، خبر Liquid AI صرفاً یک محصول تازه نیست؛ نشانهای است از اینکه لایهی «لبه» دارد جدی میشود. اگر سازندهی محصول هستید، ارزش دارد از همین حالا از خودتان بپرسید کدام بخش از کارهای مدلی که به کلاود میفرستید، واقعاً به کلاود نیاز دارد. برای دنبالکردن ادامهی این رقابت، بخش اخبار هوش مصنوعی را زیر نظر داشته باشید.
پرسشهای پرتکرار دربارهی مدلهای هوش مصنوعی رویدستگاه
آیا LFM2.5-2.6B واقعاً بدون اینترنت کار میکند؟
بله. کل ایدهی این مدل همین است؛ پس از دانلود اولیهی فایل مدل، پردازش روی خودِ دستگاه انجام میشود و نیازی به اتصال شبکه نیست. البته اگر ایجنتی بسازید که ابزارهایش به اینترنت وصل باشند (مثلاً جستوجوی وب)، آن ابزارها همچنان به شبکه نیاز دارند؛ اما خودِ مدل نه.
برای اجرای چنین مدلی چه سختافزاری لازم است؟
طبق اعلام سازنده، این مدل با کمتر از ۲.۵ گیگابایت حافظه اجرا میشود. یعنی گوشیها و لپتاپهای میانردهی امروزی از پس آن برمیآیند. سرعت اعلامشدهی ۲۲۰ توکن در ثانیه مربوط به تراشهی اپل M5 Max است و روی سختافزار ضعیفتر طبیعتاً کمتر خواهد بود، اما همچنان برای کاربردهای تعاملی قابل قبول است.
آیا این مدل جای چتجیپیتی را میگیرد؟
خیر. کاربرد این مدل، دستیارهای سریع، ایجنتهای سبک و پردازشهای حساس به حریم خصوصی است، نه رقابت با بزرگترین مدلهای ابری در استدلالهای پیچیده. مقایسهی درستتر، مقایسه با دیگر مدلهای کوچک است؛ همانطور که در مقایسههای مدلبهمدل هم میبینیم، هر مدل برای یک کلاس از کارها ساخته شده است.
هزینهی استفاده از مدل رویدستگاه چقدر است؟
هزینهی متغیر آن تقریباً صفر است، چون توکنی به سروری فروخته نمیشود. آنچه میپردازید، مصرف باتری و منابع دستگاه است، بهعلاوهی زمانی که برای راهاندازی و بهینهسازی صرف میکنید. برای محصولاتی با تعداد کاربر بالا، همین حذف هزینهی متغیر میتواند مدل کسبوکار را از پایه تغییر دهد.
مدل «ایجنتیک» یعنی چه؟
یعنی مدلی که فقط پاسخ متنی نمیدهد، بلکه میتواند برای رسیدن به یک هدف برنامه بریزد، ابزارها و توابع بیرونی را صدا بزند، نتیجه را ارزیابی کند و قدم بعدی را انتخاب کند. همین توانایی است که با تستهایی مثل ToolSandbox سنجیده میشود و LFM2.5-2.6B روی آن تمرکز کرده است.
