واترمارک پروتئین‌های هوش مصنوعی: گوگل دیپ‌مایند SynthID Bio را رونمایی کرد

اخبار · هوش مصنوعی

گوگل دیپ‌مایند فناوری تازه‌ای به نام SynthID Bio معرفی کرده که یک برچسب دیجیتال نامرئی داخل پروتئین‌های طراحی‌شده با هوش مصنوعی می‌کارد؛ برچسبی که حتی بعد از ساخت فیزیکی مولکول در آزمایشگاه هم باقی می‌ماند.

چکیده. دیپ‌مایند با انتشار مقاله‌ای در نشریه‌ی Nature از فناوری SynthID Bio رونمایی کرده است؛ سیستمی که یک امضای دیجیتال نامرئی داخل توالی یا ساختار پروتئین‌های طراحی‌شده با هوش مصنوعی جا می‌گذارد. این برچسب حتی پس از سنتز فیزیکی پروتئین در آزمایشگاه هم باقی می‌ماند و با نرخ خطای مثبت کاذب تنها یک‌دهم درصد، قابل شناسایی است. هدف اصلی، جلوگیری از سوءاستفاده‌ی احتمالی از مدل‌های طراحی پروتئین برای ساخت مولکول‌های خطرناک و پاک‌سازی پایگاه‌های داده‌ی علمی از نمونه‌های اشتباه ثبت‌شده است.

تصور گرافیکی از واترمارک نامرئی گوگل دیپ‌مایند روی ساختار پروتئین طراحی‌شده با هوش مصنوعی

۱. دیپ‌مایند دقیقاً چه چیزی رونمایی کرده است؟

گوگل دیپ‌مایند روز سه‌شنبه فناوری تازه‌ای با نام SynthID Bio را معرفی کرد؛ ادامه‌ی همان خانواده‌ی واترمارک SynthID که پیش‌تر برای نشان‌گذاری متن، تصویر و ویدیوی تولیدشده با هوش مصنوعی به کار می‌رفت. این بار اما هدف، دنیای زیست‌شناسی است. سیستم تازه یک الگوی نامرئی و قابل‌تشخیص داخل توالی اسیدهای آمینه یا ساختار سه‌بعدی پروتئین‌های طراحی‌شده با هوش مصنوعی جا می‌گذارد، بدون آن‌که عملکرد بیولوژیکی آن پروتئین را مختل کند.

نکته‌ی مهم این است که این واترمارک فقط یک برچسب دیجیتالی روی فایل نیست؛ بلکه در خودِ ساختار فیزیکی مولکول کدگذاری می‌شود. یعنی حتی وقتی پروتئین در آزمایشگاه سنتز شود، خشک شود، جابه‌جا شود یا سال‌ها بعد دوباره توالی‌یابی شود، همچنان می‌توان ردپای هوش‌مصنوعی‌بودن آن را پیدا کرد. اگر دوست دارید با مفهوم کلی قابلیت‌ها و محدودیت‌های واقعی این نسل از مدل‌های هوش مصنوعی بیشتر آشنا شوید، این مقاله درباره‌ی پتانسیل و محدودیت‌های واقعی هوش مصنوعی را هم بخوانید.

۲. چرا اصلاً به واترمارک‌گذاری پروتئین‌ها نیاز داریم؟

در چند سال اخیر، مدل‌هایی مثل AlphaFold و ProteinMPNN توانایی شگفت‌انگیزی در طراحی پروتئین‌های کاملاً تازه پیدا کرده‌اند؛ پروتئین‌هایی که در طبیعت وجود ندارند اما می‌توانند عملکردهای دارویی، صنعتی یا پژوهشی مفیدی داشته باشند. همین قدرت اما یک نگرانی جدی هم به همراه آورده: اگر این مدل‌ها بتوانند روزی برای طراحی سم، پاتوژن یا مولکول‌های خطرناک زیستی هم استفاده شوند چه باید کرد؟

دیپ‌مایند می‌گوید SynthID Bio قرار نیست به‌تنهایی جلوی چنین سوءاستفاده‌ای را بگیرد، اما می‌تواند یک «لایه‌ی منشأ» (Provenance Layer) باشد؛ یعنی ابزاری که به نهادهای نظارتی، شرکت‌های سنتز DNA و پژوهشگران کمک می‌کند بفهمند یک توالی ژنتیکی از کجا آمده و با کدام مدل طراحی شده است. این دقیقاً همان‌جایی است که بحث شفافیت و اهمیت هوش مصنوعی در تصمیم‌گیری‌های حساس کسب‌وکاری و علمی را پررنگ می‌کند؛ موضوعی که در این مطلب درباره‌ی اهمیت هوش مصنوعی در کسب‌وکار هم به آن پرداخته‌ایم.

۳. SynthID Bio از نظر فنی دقیقاً چطور کار می‌کند؟

دیپ‌مایند دو روش مجزا برای کاشتن این واترمارک به کار گرفته است. روش اول، تعبیه‌ی مستقیم الگوی واترمارک در مدل توالی‌ساز ProteinMPNN است؛ یعنی وقتی مدل یک توالی اسید آمینه‌ی تازه تولید می‌کند، خودِ فرآیند تولید، نشانه را درون توالی جا می‌گذارد. روش دوم پیچیده‌تر است: تنظیم‌دقیق وزن‌های شبکه‌ی انتشار (دیفیوژن) در AlphaFold 3، به‌گونه‌ای که امضای واترمارک در سطح ساختار سه‌بعدی پروتئین کدگذاری می‌شود، نه فقط در توالی متنی آن.

این یعنی واترمارک به مدل‌ها «آموزش داده شده»، نه این‌که بعداً روی خروجی چسبانده شود. چنین رویکردی شباهت زیادی به منطق کلی طراحی سیستم‌های هوش مصنوعی مسئولانه دارد که در آن، ویژگی‌های ایمنی از همان مرحله‌ی آموزش مدل در نظر گرفته می‌شوند، نه به‌عنوان یک وصله‌ی بعدی.

۴. نتایج آزمایش روی پروتئین‌های واقعی چه بود؟

تیم دیپ‌مایند این فناوری را روی سه پروتئین هدف واقعی آزمایش کرد: پروتئین اسپایک ویروس کرونا (SARS-CoV-2 RBD)، فاکتور رشد اندوتلیال عروقی (VEGF-A) و پروتئین PD-L1 که در ایمونوتراپی سرطان اهمیت دارد. نتایج نشان داد نمونه‌های واترمارک‌دار از نظر میزان اتصال به هدف، دقت ساختاری و تنوع طبیعی، تقریباً همان عملکردی را داشتند که نمونه‌های بدون واترمارک داشتند؛ یعنی افزودن این برچسب پنهان، عملکرد زیستی پروتئین را عملاً خراب نکرد.

از نظر دقت تشخیص هم، دیپ‌مایند آستانه‌ای تعریف کرده که در آن نرخ خطای مثبت کاذب تنها یک‌دهم درصد است؛ یعنی احتمال این‌که یک پروتئین طبیعی به‌اشتباه «ساخته‌شده با هوش مصنوعی» تشخیص داده شود، بسیار پایین است. با این حال، خودِ شرکت تأکید می‌کند که نرخ تشخیص صددرصدی تضمین‌شده نیست و به کیفیت واترمارک‌گذاری هر طراحی خاص بستگی دارد.

نمودار مفهومی دقت تشخیص واترمارک زیستی SynthID Bio روی پروتئین‌های آزمایشی

۵. همکاری با دانشگاه استنفورد و مؤسسه‌ی آرک

این پروژه محدود به دیپ‌مایند نمانده است. آزمایشگاه Hie در دانشگاه استنفورد و مؤسسه‌ی پژوهشی آرک (Arc Institute) هم به این طرح پیوسته‌اند تا مدل‌های ژنومی بزرگ مثل Evo 2 را هم زیر همین چتر امنیتی ببرند. همچنین جیمز دیگنز از شرکت Twist Bioscience، یکی از بزرگ‌ترین شرکت‌های سنتز DNA در دنیا، بازخوردهای اولیه‌ای به تیم دیپ‌مایند ارائه داده؛ هرچند تا امروز هیچ شرکت سنتز DNA رسماً اعلام نکرده که این سیستم را در خط تولید خود پیاده‌سازی کرده است.

این نوع همکاری بین‌المللی و بین‌رشته‌ای، یادآور همان الگویی است که در توسعه‌ی مدل‌های زبانی بزرگ هم دیده‌ایم؛ جایی که آزمایشگاه‌های رقیب گاهی روی استانداردهای ایمنی مشترک همکاری می‌کنند، حتی وقتی در رقابت تجاری مستقیم با هم هستند.

۶. شکاف امنیتی که هنوز حل نشده

دیپ‌مایند صادقانه اعتراف کرده که SynthID Bio یک راه‌حل قطعی و نهایی نیست. اگر فردی عمداً و با دانش فنی کافی تلاش کند واترمارک را از توالی یا ساختار پروتئین حذف یا دستکاری کند، سیستم فعلی هیچ تضمینی برای مقابله با این نوع دستکاری عمدی ندارد. شرکت این مسئله را رسماً یک «چالش باز» (Open Challenge) نامیده است.

مسئله‌ی دوم هم همان‌قدر مهم است: نبود واترمارک روی یک پروتئین، به‌تنهایی هیچ اطلاعاتی نمی‌دهد. ممکن است آن پروتئین کاملاً طبیعی باشد، ممکن است با مدلی ساخته شده باشد که اصلاً از این فناوری پشتیبانی نمی‌کند، یا ممکن است نشانه‌اش عمداً پاک شده باشد. به همین دلیل دیپ‌مایند تأکید می‌کند که SynthID Bio باید در کنار لایه‌های امنیتی دیگر – مثل غربالگری سفارش‌های DNA و نظارت انسانی – به کار گرفته شود، نه به‌عنوان تنها خط دفاعی.

۷. مشکل پایگاه‌های داده‌ی علمی و «پروتئین‌های قلابی»

شاید کاربرد فوری‌تر و عملی‌تر این فناوری، نه مقابله با تهدیدهای امنیتی آینده، بلکه پاک‌سازی وضعیت کنونی پایگاه‌های داده‌ی علمی باشد. در حال حاضر در بانک‌های اطلاعاتی بزرگی مثل Protein Data Bank، UniProt و GenBank، گاهی پروتئین‌های طراحی‌شده با هوش مصنوعی به‌اشتباه به‌عنوان نمونه‌ی «طبیعی» ثبت می‌شوند. این اشتباهات می‌توانند تصمیم‌های پژوهشی و حتی ارزیابی‌های امنیتی را منحرف کنند.

برای همین کاربرد، دیپ‌مایند می‌گوید نیازی به مقاومت صددرصدی در برابر دستکاری عمدی نیست؛ چون کسی که در حال ثبت یک نتیجه‌ی علمی در یک پایگاه‌ داده‌ی معتبر است، معمولاً انگیزه‌ای برای حذف عمدی واترمارک ندارد. در این سناریو، واترمارک صرفاً باید در برابر «جابه‌جایی و نگهداری معمولی» مقاوم باشد، نه در برابر یک مهاجم مصمم؛ و طبق داده‌های منتشرشده، در همین سطح عملکرد قابل‌قبولی دارد.

همکاری دانشگاه استنفورد و مؤسسه آرک با گوگل دیپ‌مایند در پروژه واترمارک زیستی هوش مصنوعی

۸. این اتفاق در نقشه‌ی بزرگ‌تر ایمنی هوش مصنوعی زیستی کجا قرار می‌گیرد؟

SynthID Bio تنها تلاش دیپ‌مایند در حوزه‌ی ایمنی زیستی نیست. پیش‌تر هم این آزمایشگاه همراه با شرکت آیزومورفیک روی پروژه‌هایی در زمینه‌ی کاهش خطر سلاح‌های بیولوژیک مبتنی بر هوش مصنوعی کار کرده بود. حرکت فعلی را می‌توان بخشی از یک روند بزرگ‌تر در کل صنعت دید: همان‌طور که آنتروپیک روی واترمارک متنی کار می‌کند و اپن‌ای‌آی هم اقدامات ایمنی خودش را برای مدل‌های پیشرفته اعلام کرده، گوگل هم اکنون تمرکز مشابهی روی لایه‌ی زیستی گذاشته است.

این روند نشان می‌دهد صنعت هوش مصنوعی به‌تدریج از بحث «چه کاری می‌توانیم انجام دهیم» به سمت «چطور از سوءاستفاده از این قابلیت‌ها جلوگیری کنیم» حرکت کرده است؛ تحولی که برای هر کسی که دنبال درک درست از آینده‌ی این فناوری است، قابل‌توجه خواهد بود. برای کسانی که می‌خواهند تصویر کلی‌تری از شرکت‌های پیشرو در این عرصه داشته باشند، این معرفی کامل از اوپن‌ای‌آی نقطه‌ی شروع خوبی است، و برای مقایسه‌ی رویکرد چند آزمایشگاه رقیب هم می‌توانید نگاهی به این مقایسه‌ی میدانی بین چت‌جی‌پی‌تی و دیپ‌سیک بیندازید.

۹. این خبر برای کاربران عادی هوش مصنوعی چه معنایی دارد؟

شاید در نگاه اول به نظر برسد SynthID Bio فقط به دانشمندان زیست‌شناسی و آزمایشگاه‌ها مربوط است، اما داستان بزرگ‌تر از این حرف‌هاست. این نمونه‌ی تازه‌ای است از این‌که چطور ابزارهای هوش مصنوعی مولد – از تولید متن و تصویر گرفته تا طراحی مولکول – همگی با چالش مشابهی روبه‌رو هستند: چطور می‌توان خروجی ماشین را از خروجی انسان یا طبیعت تشخیص داد؟ اگر به یادگیری نحوه‌ی تعامل درست و مسئولانه با ابزارهای هوش مصنوعی علاقه دارید، آموزش‌های چت‌جی‌پی‌تی در سایت ما و راهنمای نوشتن پرامپت برای مبتدیان می‌توانند نقطه‌ی شروع خوبی باشند.

در نهایت، بحث شفافیت و ردیابی منشأ محتوای تولیدشده با هوش مصنوعی – چه یک متن باشد، چه یک تصویر و چه یک پروتئین – به یکی از مهم‌ترین موضوعات سال‌های آینده‌ی این صنعت تبدیل شده است. برای درک بهتر تفاوت واقعی بین کاری که یک توسعه‌دهنده‌ی مستقل با کمک هوش مصنوعی انجام می‌دهد و کاری که یک مهندس حرفه‌ای انجام می‌دهد، این مطلب درباره‌ی توهم هوش مصنوعی در برابر مهندسی واقعی هم خواندنی است.

پرسش‌های پرتکرار درباره‌ی SynthID Bio

آیا SynthID Bio روی تمام پروتئین‌های دنیا قابل اجراست؟
خیر. این فناوری فقط روی پروتئین‌هایی کار می‌کند که از ابتدا با مدل‌های سازگار با آن (مثل ProteinMPNN یا AlphaFold 3 واترمارک‌دار) طراحی شده باشند؛ روی پروتئین‌های طبیعی یا پروتئین‌هایی که با مدل‌های دیگر ساخته شده‌اند، هیچ نشانه‌ای وجود نخواهد داشت.

آیا این واترمارک با چشم یا آزمایش ساده قابل‌مشاهده است؟
خیر، واترمارک کاملاً نامرئی است و تشخیص آن به ابزارهای تحلیلی اختصاصی دیپ‌مایند نیاز دارد؛ از نظر ظاهری و عملکردی، پروتئین واترمارک‌دار و بدون واترمارک یکسان به نظر می‌رسند.

آیا این یعنی مشکل سوءاستفاده از هوش مصنوعی در زیست‌شناسی کاملاً حل شده؟
خیر. حتی دیپ‌مایند هم تأکید می‌کند این فناوری فقط یک لایه از یک سیستم امنیتی چندلایه است و در برابر حذف عمدی و آگاهانه‌ی واترمارک توسط یک مهاجم مصمم، تضمین کاملی ارائه نمی‌دهد.

چه زمانی این فناوری در دسترس عموم پژوهشگران قرار می‌گیرد؟
دیپ‌مایند مقاله‌ی علمی این پروژه را منتشر کرده و با شرکای دانشگاهی مثل استنفورد و مؤسسه‌ی آرک همکاری می‌کند، اما هنوز هیچ شرکت تجاری سنتز DNA رسماً اعلام نکرده که این سیستم را به‌طور کامل در خط تولید خود پیاده‌سازی کرده است.

جمع‌بندی. SynthID Bio نشان می‌دهد مسابقه‌ی هوش مصنوعی فقط درباره‌ی قدرتمندتر شدن مدل‌ها نیست؛ بخش بزرگی از آن هم به ساختن ابزارهایی برای کنترل و ردیابی همین قدرت اختصاص دارد. برای دنبال‌کردن لحظه‌به‌لحظه‌ی مهم‌ترین اخبار هوش مصنوعی دنیا، کانال @MrChatGPT_IR را دنبال کنید و سری هم به بخش تازه‌ترین اخبار هوش مصنوعی در سایت بزنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *