ربات انسان‌نما با مدل جمینای روباتیکس ۲ و کنترل کل بدن

جمینای روباتیکس ۲ رونمایی شد؛ کنترل کل بدن ربات از پا تا انگشتان

اخبار · هوش مصنوعی

گوگل دیپ‌مایند نسل تازه‌ی مدل‌های رباتیک خود را معرفی کرد و این‌بار دامنه‌ی کنترل از «یک بازوی مکانیکی» به «کل بدن ربات» رسیده است. جمینای روباتیکس ۲ می‌تواند هم‌زمان تعادل، گام برداشتن، خم شدن و حرکت انگشتان را مدیریت کند. مهم‌تر از آن، این خبر یک مدل نیست؛ سه مدل مکمل است که با هم یک پشته‌ی کامل برای هوش مصنوعی فیزیکی می‌سازند. اعداد منتشرشده نشان می‌دهد فاصله‌ی نمایش‌های تبلیغاتی و کارهای واقعی کم‌تر شده است.

چکیده. گوگل دیپ‌مایند در پایان جولای ۲۰۲۶ از جمینای روباتیکس ۲ رونمایی کرد؛ خانواده‌ای سه‌مدلی شامل مدل بینایی-زبان-کنش، مدل استدلال مجسم و مدل روی‌دستگاه. تازه‌ترین قابلیت، کنترل کل بدن ربات‌های انسان‌نما از پا تا نوک انگشتان و همکاری چند ربات با بدن‌های متفاوت است. در آزمون‌های منتشرشده، نرخ موفقیت در جاگذاری دقیق قطعات ۸۹٫۶ درصد و در باز کردن لامپ ۹۲ درصد گزارش شده است. دسترسی فعلاً پله‌ای است: مدل استدلال در پیش‌نمایش عمومی، مدل کنش برای شرکای منتخب و مدل روی‌دستگاه برای آزمایش‌کنندگان مورد اعتماد.
ربات انسان‌نما با مدل جمینای روباتیکس ۲ و کنترل کل بدن

۱) ماجرا از چه قرار است؟

گوگل دیپ‌مایند در سی‌ام جولای ۲۰۲۶ از جمینای روباتیکس ۲ پرده برداشت. برخلاف موج خبرهای رباتیک که معمولاً روی یک ویدیوی تماشایی تکیه می‌کنند، این رونمایی یک بسته‌ی فنی کامل بود: سه مدل با نقش‌های متفاوت، فهرستی از سخت‌افزارهای پشتیبانی‌شده، اعداد بنچمارک و یک بنچمارک ایمنی جداگانه.

پیام اصلی هم روشن است. تا پیش از این، بیشتر مدل‌های رباتیک روی «دستکاری» تمرکز داشتند؛ یعنی یک بازو و یک گریپر که شیئی را برمی‌دارد و جایی می‌گذارد. جمینای روباتیکس ۲ سراغ مسئله‌ی سخت‌تر رفته است: هم‌زمان مدیریت تعادل، جابه‌جایی کل بدن و حرکت ظریف انگشتان. در زبان مهندسی رباتیک، این تفاوت میان «کنترل بازو» و «کنترل کل بدن» یک جهش محسوب می‌شود، چون تعداد درجات آزادی و احتمال ناپایداری به‌شدت بالا می‌رود.

اگر دنبال دنبال‌کردن روزبه‌روز این تحولات هستید، بخش اخبار هوش مصنوعی ما را از دست ندهید؛ رقابت رباتیک در سال ۲۰۲۶ سریع‌ترین بخش این صنعت بوده است.

۲) سه مدل، سه نقش متفاوت

نکته‌ی کلیدی این رونمایی، معماری لایه‌ای آن است. گوگل به‌جای یک مدل غول‌آسا، کار را میان سه مدل تقسیم کرده است تا هر لایه در سرعت و توان مورد نیاز خودش بهینه باشد.

مدل کنش: از جمله‌ی فارسی تا حرکت موتور

مدل اصلی، یک مدل بینایی-زبان-کنش است؛ یعنی تصویر دوربین و دستور زبانی را می‌گیرد و خروجی‌اش فرمان حرکتی موتورها است. همین مدل است که کنترل کل بدن، دستکاری با دست‌های پنج‌انگشتی و کار با گریپرهای معمولی را ممکن می‌کند.

مدل استدلال مجسم: مغز برنامه‌ریز

لایه‌ی بالاتر، مدلی است که گوگل آن را جمینای روباتیکس ای‌آر ۲ می‌نامد. این مدل بر پایه‌ی جمینای ۳٫۵ فلش ساخته شده، پنجره‌ی زمینه‌ای ۱۲۸ هزار توکنی دارد و کارش برنامه‌ریزی چندمرحله‌ای است: تشخیص این‌که کار به کجا رسیده، پیدا کردن لحظه‌ی مهم در یک ویدیو و فراخواندن ابزارهای بیرونی از طریق رابط زنده‌ی جمینای.

مدل روی‌دستگاه: سازگاری سریع بدون اینترنت

سومین عضو خانواده، نسخه‌ای سبک است که روی خود ربات اجرا می‌شود و بر پایه‌ی نسل قبلی و مدل‌های سبک جما ساخته شده است. مزیت این مدل تأخیر کم و استقلال از شبکه است؛ چیزی که برای کارخانه یا محیط‌های بدون اتصال پایدار حیاتی است.

۳) کنترل کل بدن دقیقاً چه فرقی می‌کند؟

تصور کنید ربات باید جعبه‌ای را از قفسه‌ی پایینی بردارد. یک بازوی ثابت باید امیدوار باشد جعبه در دسترسش باشد؛ اما رباتی که کل بدنش را کنترل می‌کند می‌تواند زانو خم کند، مرکز جرمش را جابه‌جا کند، وزنش را روی یک پا بیندازد و بعد دست دراز کند. این یعنی محدوده‌ی کاری بزرگ‌تر، نیروی بیشتر و شکست کمتر.

پیچیدگی این کار در «هم‌زمانی» است. ربات باید در کسری از ثانیه تصمیم بگیرد که برای رسیدن به هدف، تعادل را چقدر می‌تواند به خطر بیندازد. تا پیش از این، چنین رفتاری معمولاً با کنترلرهای دست‌نویس و مخصوص هر ربات ساخته می‌شد. حالا گوگل می‌گوید یک مدل آموزش‌دیده می‌تواند این تصمیم را به‌صورت عمومی و برای بدن‌های مختلف بگیرد.

سه مدل خانواده‌ی جمینای روباتیکس ۲ و نقش هرکدام

۴) اعداد؛ ربات‌ها چقدر دقیق شده‌اند؟

گوگل چند عدد مشخص منتشر کرده است که ارزش نگاه دقیق دارند:

در برداشتن عمومی اشیاء از قفسه با ربات انسان‌نمای آپولو ۲ و دست‌های اینسپایر، نرخ موفقیت ۷۶٫۳ درصد گزارش شده است. در باز کردن یک لامپ با همان ربات و دست‌های شارپا، این نرخ به ۹۲ درصد می‌رسد. در جاگذاری دقیق قطعه با بازوهای فرانکا دو، نرخ موفقیت ۸۹٫۶ درصد اعلام شده است.

برای مدل استدلال هم دو عدد جداگانه منتشر شده: دقت ۵۷٫۴ درصد در تشخیص میزان پیشرفت کار و ۹۱٫۳ درصد در یافتن لحظه‌ی مورد نظر در یک ویدیو. جالب‌ترین عدد اما به مدل روی‌دستگاه مربوط است: در سازگاری با یک بازوی تازه، نرخ موفقیت از ۶٫۷ درصد به ۵۳٫۳ درصد رسیده است.

این اعداد را چطور بخوانیم؟

سه نکته را باید در نظر داشت. اول، این آزمون‌ها در محیط آزمایشگاهی و روی مجموعه‌ای محدود از وظایف انجام شده‌اند. دوم، ۹۲ درصد موفقیت در یک کار تکراری صنعتی هنوز یعنی هشت شکست در هر صد تلاش، که برای خط تولید عدد بزرگی است. سوم، جهش مدل روی‌دستگاه از ۶٫۷ به ۵۳٫۳ درصد نشان می‌دهد بخش عمده‌ی پیشرفت در «سرعت یادگیری بدن تازه» است، نه در رسیدن به دقت انسانی. همان بحث قدیمی توان و محدودیت واقعی هوش مصنوعی این‌جا هم برقرار است.

۵) همکاری چند ربات؛ بخش کم‌تر دیده‌شده‌ی خبر

یکی از قابلیت‌هایی که در سرخط‌ها کمتر دیده شد، همکاری میان ربات‌هایی با بدن‌های متفاوت است. یعنی یک ربات انسان‌نما و یک بازوی ثابت می‌توانند روی یک وظیفه‌ی مشترک کار کنند و مدل، هماهنگی میانشان را مدیریت کند.

این قابلیت از نظر تجاری مهم است، چون کارخانه‌ها و انبارها عملاً هیچ‌وقت تک‌ربات نیستند. اگر یک مدل بتواند ناهمگونی سخت‌افزار را پنهان کند، هزینه‌ی یکپارچه‌سازی به‌شدت پایین می‌آید؛ و هزینه‌ی یکپارچه‌سازی، نه قابلیت خام، همیشه گلوگاه اصلی اتوماسیون بوده است.

۶) سخت‌افزارها و شرکای گوگل

فهرست سخت‌افزارهای پشتیبانی‌شده نشان می‌دهد گوگل می‌خواهد لایه‌ی نرم‌افزار باشد، نه سازنده‌ی ربات. ربات انسان‌نمای آپولو ۲ از شرکت آپترونیک، بازوهای فرانکا و ربات چهارپای اسپات از بوستون داینامیکس در نمایش‌ها حاضر بودند و پلتفرم‌های دیگری هم در فهرست دیده می‌شود.

این راهبرد آشناست: همان کاری که سیستم‌عامل‌های موبایل با سازندگان گوشی کردند. اگر مدل‌های جمینای به استاندارد عملی رباتیک تبدیل شوند، ارزش واقعی نه در فلز و موتور، بلکه در لایه‌ی هوش خواهد بود. برای درک بهتر جایگاه بازیگران این بازار، مرور اوپن‌ای‌آی چیست و مقایسه‌ی راهبردهای رقبا کمک‌کننده است.

نرخ موفقیت ربات‌ها در آزمون‌های دستکاری ظریف

۷) دسترسی؛ چه کسی همین حالا می‌تواند استفاده کند؟

دسترسی به این خانواده پله‌ای است. مدل استدلال ای‌آر ۲ در پیش‌نمایش عمومی از طریق رابط برنامه‌نویسی جمینای و محیط ای‌آی استودیو در اختیار توسعه‌دهندگان قرار گرفته است. مدل کنش فعلاً فقط برای شرکای دسترسی زودهنگام فعال است و مدل روی‌دستگاه در برنامه‌ی آزمایش‌کنندگان مورد اعتماد ارائه می‌شود.

ترجمه‌ی این ساختار ساده است: بخش «فکر کردن» باز شده، اما بخش «حرکت دادن موتورها» هنوز بسته است. این تفکیک احتمالاً هم دلیل ایمنی دارد و هم دلیل تجاری، چون خطای یک مدل کنش می‌تواند به سخت‌افزار و انسان آسیب برساند.

۸) ایمنی؛ بنچمارکی که کنار مدل منتشر شد

گوگل هم‌زمان یک بنچمارک ایمنی با نام آسیموف-ایجنتیک را روی هاگینگ‌فیس و با مجوز آزاد منتشر کرده است. منطق این کار روشن است: وقتی مدل زبانی اشتباه می‌کند، نتیجه یک جمله‌ی نادرست است؛ وقتی مدل رباتیک اشتباه می‌کند، نتیجه می‌تواند یک جسم شکسته یا یک آسیب فیزیکی باشد.

انتشار عمومی چنین بنچمارکی به پژوهشگران بیرونی اجازه می‌دهد ادعاهای ایمنی را مستقل بسنجند. این رویکرد در سال گذشته به یک هنجار رقابتی تبدیل شده و شرکت‌های بزرگ ترجیح می‌دهند خودشان معیار سنجش را تعریف کنند.

۹) این خبر برای کاربر فارسی‌زبان چه معنایی دارد؟

در کوتاه‌مدت، تأثیر مستقیم اندک است؛ ربات انسان‌نما به‌زودی وارد خانه‌ها نمی‌شود. اما دو اثر غیرمستقیم مهم است. اول، لایه‌ی استدلال همین مدل‌ها از طریق رابط برنامه‌نویسی در دسترس است و می‌تواند در پروژه‌های بینایی ماشین، بازرسی کیفیت و تحلیل ویدیو استفاده شود. دوم، فشار رقابتی روی زنجیره‌ی تأمین صنعتی، دیر یا زود هزینه‌ی اتوماسیون را برای کسب‌وکارهای کوچک هم پایین می‌آورد.

نکته‌ی عملی‌تر این است که مهارت نوشتن دستور دقیق، در رباتیک هم همان‌قدر مهم است که در چت. اگر می‌خواهید از همین امروز تمرین کنید، راهنمای پرامپت‌نویسی و آموزش‌های چت‌جی‌پی‌تی نقطه‌ی شروع خوبی هستند. همچنین بحث توهم توسعه‌دهنده‌ی تنها یادآوری می‌کند که نمایش تماشایی با محصول قابل اتکا فاصله دارد.

پرسش‌های پرتکرار درباره‌ی جمینای روباتیکس ۲

جمینای روباتیکس ۲ چه تفاوتی با نسل قبل دارد؟

مهم‌ترین تفاوت، کنترل کل بدن ربات به‌جای تمرکز بر یک بازو است. علاوه بر آن، همکاری چند ربات با بدن‌های متفاوت و دستکاری با دست‌های پنج‌انگشتی به قابلیت‌ها اضافه شده است.

آیا این مدل‌ها برای همه در دسترس‌اند؟

نه. تنها مدل استدلال در پیش‌نمایش عمومی از طریق رابط برنامه‌نویسی جمینای و ای‌آی استودیو ارائه شده است. مدل کنش برای شرکای منتخب و مدل روی‌دستگاه برای آزمایش‌کنندگان مورد اعتماد فعال است.

بالاترین نرخ موفقیت گزارش‌شده چقدر است؟

در آزمون باز کردن لامپ با ربات آپولو ۲ و دست‌های شارپا، نرخ موفقیت ۹۲ درصد اعلام شده است. در جاگذاری دقیق قطعه با بازوهای فرانکا دو، این عدد ۸۹٫۶ درصد است.

گوگل خودش ربات می‌سازد؟

خیر. راهبرد اعلام‌شده، ارائه‌ی لایه‌ی هوش مصنوعی برای ربات‌های شرکت‌های دیگر است؛ از آپولو ۲ آپترونیک تا بازوهای فرانکا و ربات‌های بوستون داینامیکس.

ربات‌های انسان‌نما کِی به کار روزمره می‌رسند؟

هیچ زمان‌بندی رسمی اعلام نشده است. اعداد فعلی نشان می‌دهد این فناوری برای وظایف محدود و کنترل‌شده آماده‌تر است تا محیط‌های بی‌قاعده‌ی خانگی؛ بنابراین پذیرش صنعتی احتمالاً زودتر از پذیرش خانگی رخ می‌دهد.

جمع‌بندی. جمینای روباتیکس ۲ نشان می‌دهد رقابت هوش مصنوعی از صفحه‌نمایش به دنیای فیزیکی منتقل شده و گوگل می‌خواهد لایه‌ی نرم‌افزاری این دنیا باشد. اعداد منتشرشده امیدوارکننده‌اند، اما فاصله‌ی آزمایشگاه تا خط تولید هنوز واقعی است. برای دنبال‌کردن سریع‌ترین اخبار این حوزه به @MrChatGPT_IR بپیوندید.

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *