ربات‌هایی که با یک ویدیو یاد می‌گیرند؛ مدل S1 اسکیلد چه می‌کند؟

اخبار · هوش مصنوعی

استارتاپ رباتیک Skild AI مدلی به نام S1 معرفی کرده که با دیدن فقط یک ویدیوی انسانی، کارهای پیچیده و چند دقیقه‌ای را بدون هیچ آموزش اضافه یاد می‌گیرد؛ جهشی که کارشناسان آن را «لحظه‌ی GPT-3» دنیای رباتیک می‌نامند.

چکیده. مدل S1 از شرکت Skild AI به‌جای آموزش جداگانه برای هر کار، از یک ویدیوی نمونه به‌عنوان دستورالعمل استفاده می‌کند و در آزمایش‌های داخلی به ۶۶ درصد موفقیت در کارهای کاملاً جدید رسیده؛ رقمی که در برابر ۹ درصد مدل‌های سنتیِ مبتنی بر دستور زبانی، جهشی بزرگ محسوب می‌شود. با این حال، تا امروز نه وزن‌های مدل منتشر شده و نه مقاله‌ی فنی رسمی، و آنچه در دسترس است فقط چند نمایش کنترل‌شده است.

ربات هوش مصنوعی در حال یادگیری یک کار از روی ویدیوی انسانی

مدل S1 اسکیلد چیست؟

شرکت Skild AI که در حوزه‌ی مدل‌های پایه برای رباتیک فعالیت می‌کند، هفته‌ی گذشته از مدلی رونمایی کرد که آن را «S1» نام‌گذاری کرده است. برخلاف اغلب مدل‌های رباتیک رایج که برای هر کار تازه نیاز به هزاران نمونه‌ی آموزشی و تنظیم مجدد وزن‌های شبکه‌ی عصبی دارند، S1 طوری طراحی شده که بتواند «در لحظه» و فقط با دیدن یک نمونه، کار تازه را یاد بگیرد. شرکت‌سازنده این ویژگی را «یادگیری در بستر» یا in-context learning می‌نامد؛ اصطلاحی که پیش از این بیشتر در دنیای مدل‌های زبانی بزرگ شنیده می‌شد، نه در رباتیک فیزیکی.

نکته‌ی مهم این‌جاست که S1 برای یادگیری کار تازه، نیازی به دستور نوشتاری یا زبانی ندارد. کافی است یک انسان، کار مورد نظر را یک‌بار در برابر دوربین انجام دهد؛ ربات آن ویدیو را تحلیل می‌کند و بلافاصله می‌تواند نسخه‌ی خودش را از همان کار اجرا کند. این رویکرد برای وظایفی مثل تا‌کردن ملحفه، هم‌زدن سفیده‌ی تخم‌مرغ یا بستن گره، که توضیح‌دادنشان با جمله‌های زبانی دشوار است، مزیت بزرگی محسوب می‌شود.

چگونه یک ربات از روی یک ویدیو یاد می‌گیرد؟

در روش سنتی، مدل‌های رباتیک با ترکیبی از دستور زبانی و داده‌های آموزشی اختصاصی هر کار، «فاین‌تیون» یا تنظیم دقیق می‌شوند؛ فرایندی که برای هر مهارت تازه باید از نو تکرار شود. اما در معماری S1، مدل در طول آموزشِ اولیه با حجم عظیمی از داده‌های اپیزودیک روبه‌رو شده که در آن‌ها، هر کار فقط با یک یا چند نمونه‌ی درون‌بستری مشخص شده است. این شیوه‌ی آموزش، مدل را مجبور می‌کند تا نیت فرد نمایش‌دهنده، تناظرهای عملکردی میان اشیا و پیشرفت گام‌به‌گام کار را به‌صورت ضمنی درک کند؛ نه این‌که صرفاً حرکات را حفظ کند.

نتیجه‌ی این رویکرد، توانایی تعمیم به موقعیت‌های کاملاً تازه در لحظه‌ی اجراست، بدون نیاز به به‌روزرسانی وزن‌های مدل. به بیان ساده‌تر، S1 یک ویدیو را نه به‌عنوان «دستور»، بلکه به‌عنوان «مثال» می‌بیند و از روی آن مثال، منطق کلی کار را استخراج می‌کند. همین تفاوت مفهومی است که باعث شده این مدل بتواند در برابر تغییرات میانه‌ی کار هم مقاوم باشد؛ موضوعی که در بخش بعدی به آن می‌پردازیم.

کارهای نمایشی و آماری که توجه‌ها را جلب کرد

در ویدیوهای نمایشی منتشرشده توسط شرکت، ربات مجهز به مدل S1 توانسته کارهای طولانی تا ده دقیقه‌ای را با موفقیت اجرا کند؛ از جمله برگرداندن پنکیک در ماهی‌تابه، دم‌کردن قهوه به روش پورآور، گلدان‌کردن یک گیاه در خاک تازه و مونتاژ چندمرحله‌ای قطعات یک کیت. در یکی از این آزمایش‌ها، ویدیوی نمونه‌ی گلدان‌کردن گیاه ساعت ۲۱:۲۲ ضبط شده و تنها یازده دقیقه بعد، در ساعت ۲۱:۳۳، ربات به‌صورت کاملاً خودکار همان کار را اجرا کرده است؛ فاصله‌ای که نشان می‌دهد یادگیری واقعاً «در لحظه» رخ می‌دهد، نه پس از ساعت‌ها پردازش پشت‌صحنه.

از نظر آماری، وقتی مدل با صد هزار ساعت داده‌ی آموزشی تغذیه شده، در کارهای کاملاً دیده‌نشده به نرخ موفقیت ۶۶ درصد رسیده است؛ در حالی‌که یک مدل مشابه که فقط با دستور زبانی هدایت می‌شود، در همان شرایط تنها ۹ درصد موفق بوده. جالب این‌جاست که این برتری، یک قانون همیشگی نیست: در مقیاس کوچک‌تر، یعنی حدود هزار ساعت داده، مدل‌های دستور زبانی عملکرد بهتری از خود نشان دادند (پنجاه‌وسه درصد در برابر چهل‌وسه درصد). به بیان دیگر، مزیت یادگیری ویدیومحور فقط زمانی ظاهر می‌شود که حجم داده به مقیاس سازمانی برسد؛ نکته‌ای که برای تیم‌های رباتیک با بودجه‌ی محدود، اهمیت عملی زیادی دارد.

برای مقایسه، یک نسخه از مدل که پیش از اجرا برای همان کار به‌طور اختصاصی آموزش دیده بود (با دو هزار نمونه‌ی تله‌اپراسیون)، به نرخ موفقیت هشتاد‌وشش درصد رسید؛ یعنی هنوز فاصله‌ای با یادگیری اختصاصی وجود دارد، اما این فاصله برای یک روش «تک‌نمونه‌ای» قابل‌توجه است.

نمودار مقایسه‌ی دقت مدل S1 در برابر مدل‌های دستور زبانی در رباتیک

رفتارهای نوظهور؛ وقتی ربات با شرایط غیرمنتظره روبه‌رو می‌شود

یکی از جالب‌ترین ویژگی‌هایی که در گزارش‌ها به آن اشاره شده، مقاومت مدل در برابر تغییرات میانه‌ی کار است. برای مثال، اگر در حین اجرا صحنه دستکاری شود یا وسیله‌ای جابه‌جا شود، S1 تلاش می‌کند مسیر جایگزین برای رسیدن به هدف پیدا کند، به‌جای این‌که کل عملیات را متوقف کند. همچنین، وقتی حرکت اول با شکست روبه‌رو می‌شود، مدل راهبردهای دیگری را امتحان می‌کند؛ رفتاری که در مدل‌های رباتیک سنتی معمولاً از پیش برنامه‌ریزی می‌شود، نه این‌که به‌صورت خودجوش ظاهر شود.

نمونه‌ی دیگر، توانایی «جایگزینی مبتنی بر عقل سلیم» است؛ یعنی اگر وسیله‌ی دقیقاً مشابه با ویدیوی نمونه در دسترس نباشد (مثلاً به‌جای آب‌پاش، یک لیوان ساده)، ربات از جایگزین موجود استفاده می‌کند تا کار را به سرانجام برساند. همچنین گزارش شده که مدل می‌تواند عملکرد ضعیف یا ناقص در ویدیوی نمونه را هنگام اجرا اصلاح کند و نتیجه‌ی بهتری نسبت به نمونه‌ی اصلی ارائه دهد. چنین رفتارهایی، فاصله‌ی میان «تقلید صرف» و «درک واقعی از هدف کار» را نشان می‌دهد؛ موضوعی که در حوزه‌ی پتانسیل و محدودیت‌های واقعی هوش مصنوعی همیشه محل بحث بوده است.

چرا این متفاوت از مدل‌های قبلی رباتیک است؟

مدل‌های پیشین رباتیک، حتی نسخه‌های پیشرفته‌ی «مدل زبان-بینایی-عمل» یا VLA، برای هر مهارت تازه به ده‌ها تا صدها ساعت داده‌ی اختصاصی و فاین‌تیون نیاز داشتند. کارشناسان این وضعیت را با دوران BERT در تاریخ مدل‌های زبانی مقایسه می‌کنند؛ زمانی که هر کاربرد زبانی نیاز به آموزش جداگانه داشت. ظهور مدل‌هایی مثل GPT-3 این معادله را با «یادگیری در بستر» تغییر داد و همان گذار حالا در حال تکرارشدن در دنیای رباتیک فیزیکی است.

رقبایی مثل Generalist AI هم روی رویکردهای مشابه کار می‌کنند، اما بر اساس گزارش‌های منتشرشده، عمدتاً روی کارهای کوتاه‌مدت یا کارهایی که از قبل در داده‌ی آموزشی وجود داشته‌اند متمرکزند. آنچه S1 را متمایز می‌کند، ترکیب هم‌زمان دو ویژگی دشوار است: افق زمانی طولانی (تا ده دقیقه) و تازگی کامل کار برای مدل. رسیدن هم‌زمان به این دو ویژگی، چیزی است که تا پیش از این در دنیای رباتیک عمومی دیده نشده بود. برای درک بهتر تفاوت رویکردهای مدل‌محور با روش‌های سنتی‌تر، می‌توانید نگاهی هم به تجربه‌ی رقابت مدل‌های زبانی در مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک بیندازید که نمونه‌ای از رقابت رویکردهای متفاوت در هوش مصنوعی است.

استراتژی داده و پشتوانه‌ی مالی Skild AI

شرکت Skild AI پیش‌تر در یکی از دورهای سرمایه‌گذاری خود به بیش از ۱.۴ میلیارد دلار سرمایه دست پیدا کرده و ارزش‌گذاری‌اش از مرز ۱۴ میلیارد دلار عبور کرده است. این استارتاپ با نام‌های شناخته‌شده‌ای در صنعت رباتیک صنعتی مانند ABB Robotics، Universal Robots و MiR (Mobile Industrial Robots) همکاری دارد؛ همکاری‌هایی که مسیر ورود این فناوری به خطوط تولید واقعی را هموار می‌کند.

در مورد منبع داده، Skild AI به‌جای تکیه بر یک منبع واحد، از چهار کانال موازی استفاده می‌کند: تله‌اپراسیون مستقیم ربات (دقت سخت‌افزاری بالا اما مقیاس‌پذیری پایین)، سامانه‌های UMI (ترکیب متعادل)، ویدیوی اول‌شخص انسانی (تنوع و مقیاس‌پذیری بالا، اما فاصله‌ی دامنه‌ی بیشتر) و داده‌ی شبیه‌سازی‌شده (مقیاس‌پذیر با وفاداری متوسط). به گفته‌ی شرکت، برای هر یک دلار هزینه‌ی جمع‌آوری داده، سه دلار صرف کنترل کیفیت آن می‌شود؛ رقمی که نشان می‌دهد بخش زیادی از سرمایه‌گذاری این استارتاپ، صرف تمیزکردن و اعتبارسنجی داده‌ها شده، نه صرفاً جمع‌آوری حجم بیشتر.

محدودیت‌ها و نکات احتیاط‌آمیز

با وجود آمار چشمگیر، باید چند نکته‌ی مهم را هم در نظر گرفت. تا لحظه‌ی انتشار این مقاله، Skild AI هیچ وزن عمومی، رابط برنامه‌نویسی کاربردی (API)، قیمت‌گذاری یا مقاله‌ی فنی رسمی برای S1 منتشر نکرده است. آنچه در دسترس عموم قرار دارد، تنها یک بنچمارک داخلی و چهار نمونه‌ی ویدیویی کنترل‌شده از سوی خود شرکت است؛ به این معنا که ارزیابی مستقل از سوی آزمایشگاه‌های دیگر هنوز انجام نشده. این موضوع، درسی آشنا برای هر کسی است که با ادعاهای بزرگ حوزه‌ی هوش مصنوعی سروکار دارد؛ همان‌طور که در مقاله‌ی توهم هوش مصنوعی و تفاوت توسعه‌دهنده‌ی تنها با مهندس واقعی هم به آن پرداخته‌ایم، فاصله‌ی میان دموی کنترل‌شده و محصول قابل‌اتکا در دنیای واقعی می‌تواند قابل‌توجه باشد.

هم‌چنین، خود گزارش‌های اولیه اشاره می‌کنند که مزیت روش ویدیومحور تنها در مقیاس داده‌ی بسیار بزرگ ظاهر می‌شود؛ برای تیم‌هایی با مجموعه‌داده‌ی محدود، همچنان دستور زبانی می‌تواند گزینه‌ی عملی‌تری باشد. به همین دلیل، این فناوری فعلاً بیشتر برای شرکت‌های بزرگ با منابع داده‌ی گسترده کاربرد دارد تا تیم‌های کوچک رباتیک.

ربات صنعتی نسل جدید مجهز به یادگیری خودکار از ویدیو

این پیشرفت برای صنعت رباتیک و هوش مصنوعی چه معنایی دارد؟

اگر ادعاهای Skild AI در آزمایش‌های مستقل هم تأیید شود، می‌تواند مسیر توسعه‌ی ربات‌های خدماتی، خانگی و صنعتی را برای سال‌های آینده دگرگون کند. کاهش نیاز به آموزش اختصاصی برای هر کار، یعنی کاهش چشمگیر هزینه و زمان استقرار ربات‌ها در محیط‌های تازه؛ از انبارهای لجستیک گرفته تا آشپزخانه‌های خانگی. این روند هم‌راستا با موجی گسترده‌تر است که در آن هوش مصنوعی به‌جای جایگزینی کامل انسان، به دستیاری تبدیل می‌شود که سریع‌تر یاد می‌گیرد؛ روندی که پیامدهای اقتصادی آن را می‌توانید در مقاله‌ی اهمیت هوش مصنوعی برای کسب‌وکارها در سال ۲۰۲۵ دنبال کنید.

از سوی دیگر، این رویداد یادآور این نکته است که رقابت هوش مصنوعی دیگر محدود به مدل‌های زبانی و چت‌بات‌ها نیست. همان‌طور که پیش‌تر در معرفی OpenAI و مسیر توسعه‌ی این شرکت بررسی کردیم، رقابت اصلی این روزها بر سر این است که کدام آزمایشگاه، مدلی بسازد که با کمترین داده، بیشترین تعمیم را به دست بیاورد؛ چه در متن، چه در تصویر و چه حالا در حرکت فیزیکی ربات‌ها.

سوالات متداول درباره‌ی مدل S1 اسکیلد

مدل S1 دقیقاً چه کاری انجام می‌دهد؟
این مدل با دیدن یک ویدیوی انسانی از انجام یک کار، همان کار را بدون آموزش اضافه یا فاین‌تیون تکرار می‌کند.

آیا S1 برای عموم در دسترس است؟
خیر؛ در حال حاضر نه وزن‌های مدل و نه API عمومی منتشر نشده و فقط نمایش‌های کنترل‌شده در دسترس است.

چه تفاوتی با مدل‌های رباتیک قبلی دارد؟
مدل‌های قبلی برای هر کار تازه نیاز به آموزش اختصاصی داشتند؛ S1 با یک نمونه‌ی ویدیویی، در لحظه یاد می‌گیرد.

آیا این روش برای همه‌ی تیم‌های رباتیک مناسب است؟
خیر؛ مزیت اصلی آن فقط در مقیاس داده‌ی بسیار بزرگ ظاهر می‌شود، بنابراین بیشتر برای شرکت‌های بزرگ کاربردی است.

جمع‌بندی این‌که مدل S1 از Skild AI، با رویکرد «یادگیری از یک ویدیو»، یکی از جدی‌ترین گام‌ها به‌سوی ربات‌های عمومی و انعطاف‌پذیر است؛ هرچند هنوز باید منتظر ارزیابی‌های مستقل و انتشار عمومی آن ماند. برای دنبال‌کردن به‌روزترین اخبار هوش مصنوعی و تحلیل‌های مشابه، کانال تلگرام @MrChatGPT_IR را دنبال کنید. برای مطالعه‌ی سایر خبرهای روز هوش مصنوعی هم می‌توانید سری به بخش اخبار سایت بزنید یا در آموزش‌های چت‌جی‌پی‌تی مهارت‌های تازه یاد بگیرید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *