نشت سورس‌کد سونو و افشای منابع داده آموزشی این ابزار موسیقی هوش مصنوعی

سورس‌کد سونو لو رفت؛ راز داده‌های آموزشی موسیقی هوش مصنوعی فاش شد

اخبار · هوش مصنوعی

یک هک، پرده‌ی بزرگی را کنار زد. سورس‌کد سونو، یکی از معروف‌ترین ابزارهای ساخت موسیقی با هوش مصنوعی، لو رفت و برای نخستین‌بار مشخص شد این شرکت مدلش را با چه چیزی آموزش داده است. اسناد درزکرده از میلیون‌ها قطعه‌ی موسیقی و ده‌ها هزار ساعت صدا حکایت دارد که بدون اجازه از پلتفرم‌های مختلف برداشته شده‌اند. حالا این افشاگری درست در میانه‌ی یک پرونده‌ی حقوقی چند میلیارد دلاری منتشر شده است.

چکیده. طبق گزارش‌ها، سورس‌کد سونو در پی یک حمله‌ی زنجیره‌ی تأمین در نوامبر ۲۰۲۵ به دست یک هکر افتاد و در جولای ۲۰۲۶ محتوای آن منتشر شد. فایل‌های درزکرده نشان می‌دهد بیش از دو میلیون قطعه از یوتیوب موزیک و ده‌ها هزار ساعت صدا از دیزر، جینیوس، کتابخانه‌های موسیقی و پادکست‌ها جمع‌آوری شده است. یونیورسال و سونی موزیک در پرونده‌ای که با هماهنگی انجمن صنعت ضبط آمریکا پیش می‌رود، خواستار گسترش دامنه‌ی شکایت شده‌اند؛ گسترشی که جریمه‌ی احتمالی را از حدود ۸۴ میلیون دلار به بیش از ۹ میلیارد دلار می‌رساند.
نشت سورس‌کد سونو و افشای منابع داده آموزشی این ابزار موسیقی هوش مصنوعی

۱) ماجرا از کجا شروع شد؟

طبق گزارش‌های منتشرشده، در نوامبر ۲۰۲۵ یک هکر با اجرای حمله‌ی زنجیره‌ی تأمین موفق شد اعتبارنامه‌ی ورود یکی از کارکنان سونو را به دست بیاورد. این دسترسی، راه را به سورس‌کد شرکت باز کرد.

خودِ نفوذ در همان زمان چندان بازتاب نداشت. سونو آن را «یک رخداد امنیتی محدود که به‌سرعت مهار شد» توصیف کرد و طبق گزارش‌ها، مشتریان را در جریان قرار نداد. این در حالی است که بنا بر همان گزارش‌ها، اطلاعاتی مانند ایمیل، شماره تلفن و بخشی از شماره‌ی کارت بانکی کاربران هم در معرض دسترسی قرار گرفته بود.

نقطه‌ی عطف ماجرا جولای ۲۰۲۶ بود؛ زمانی که محتوای این کد و به‌ویژه فایل‌های مربوط به داده‌های آموزشی، در دسترس رسانه‌ها قرار گرفت و تحلیل آن‌ها منتشر شد.

۲) اعداد افشاشده؛ حجم واقعی داده‌ی آموزشی

مهم‌ترین بخش افشاگری، فهرست منابع داده است. طبق گزارش‌ها، در این فایل‌ها بیش از دو میلیون قطعه‌ی موسیقی از یوتیوب موزیک ثبت شده است؛ دقیق‌تر بگوییم رقم ۲،۰۱۳،۵۴۵ قطعه گزارش شده. علاوه بر آن، بیش از ۱۱۳ هزار ساعت با برچسب یوتیوب موزیک و بیش از ۱۵۲ هزار ساعت با برچسبی دیگر مربوط به همین منبع ثبت شده است.

فهرست به یوتیوب محدود نمی‌شود. طبق همین گزارش‌ها، حدود ۱۲ هزار ساعت از دیزر، بیش از ۱۷ هزار ساعت از جینیوس، بیش از ۶۲ هزار ساعت از کتابخانه‌ی موسیقی پاند فایو و حدود ۱۹ هزار ساعت از کتابخانه‌ی بین‌المللی پارتیتورهای موسیقی جمع‌آوری شده است.

بخش پادکست هم قابل توجه است: حدود ۴۲۰ هزار پادکست از طریق یک نمایه‌ی عمومی شناسایی شده و تلاش برای دانلود چیزی نزدیک به یک میلیون ساعت صدا ثبت شده است. جمع‌بندی گزارش‌ها از این مجموعه با عبارت «دست‌کم ده‌ها سال صدا» یاد می‌کند.

۳) چرا این اعداد اهمیت حقوقی دارند؟

در پرونده‌های کپی‌رایت، دشوارترین بخش کار اثبات این است که اثر مشخصی واقعاً در داده‌ی آموزشی حضور داشته است. شرکت‌های سازنده‌ی مدل معمولاً می‌گویند از «داده‌ی در دسترس عموم» استفاده کرده‌اند، بدون آن‌که فهرست دقیقی ارائه کنند.

فایل‌های درزکرده دقیقاً همان چیزی است که شاکیان سال‌ها به‌دنبالش بودند: سیاهه‌ای با نام منبع، تعداد و ساعت. اگر اصالت این اسناد در دادگاه تأیید شود، بار اثبات از دوش شاکیان برداشته می‌شود.

نکته‌ی حقوقی دوم، شیوه‌ی برداشت است. برداشت صدا از یوتیوب معمولاً مستلزم دور زدن سازوکارهای فنی این پلتفرم است و همین موضوع می‌تواند مشمول مواد مربوط به «دور زدن حفاظت فنی» در قانون کپی‌رایت هزاره‌ی دیجیتال آمریکا شود؛ بندی که جریمه‌ی جداگانه‌ای دارد.

برداشت بیش از دو میلیون قطعه موسیقی از یوتیوب موزیک برای آموزش مدل سونو

۴) پرونده‌ی حقوقی؛ از ۸۴ میلیون تا ۹ میلیارد دلار

شاکیان اصلی این پرونده یونیورسال میوزیک گروپ و سونی موزیک اینترتینمنت هستند و انجمن صنعت ضبط آمریکا هماهنگی آن را بر عهده دارد. شکایت اولیه بر پایه‌ی ۵۶۰ اثر تنظیم شده بود.

در ماه می، این دو شرکت درخواست کردند دامنه‌ی پرونده به ۶۱،۰۲۶ اثر گسترش پیدا کند؛ آثاری که به گفته‌ی آن‌ها از طریق اثرانگشت صوتی شناسایی شده‌اند. تفاوت این دو عدد در محاسبه‌ی خسارت قانونی، تفاوت میان حدود ۸۴ میلیون دلار و بیش از ۹ میلیارد دلار است.

افزون بر این، برای هر مورد دور زدن حفاظت فنی هم جریمه‌ای تا ۲،۵۰۰ دلار مطرح شده است. طبق گزارش‌ها، قاضی پرونده هنوز درباره‌ی درخواست گسترش تصمیم نگرفته است؛ تصمیمی که می‌تواند مسیر کل پرونده را تعیین کند.

۵) دفاع سونو چیست؟

موضع رسمی سونو دو بخش دارد. بخش اول درباره‌ی داده است: این شرکت اعلام کرده مدل‌هایش بر پایه‌ی «فایل‌های موسیقی در دسترس عموم و فراداده‌های مرتبط که روی وب‌سایت‌های شخص ثالث در اینترنت باز قابل دسترسی‌اند» آموزش دیده‌اند.

بخش دوم درباره‌ی خود نشت است: سونو گفته کدی که در حادثه‌ی نوامبر ۲۰۲۵ افشا شده، «سورس‌کد قدیمی» بوده است. این دفاع تلویحاً می‌گوید وضعیت فعلی شرکت لزوماً همان چیزی نیست که در اسناد دیده می‌شود.

استدلال حقوقی زیربنایی سونو، مثل بسیاری از شرکت‌های هوش مصنوعی، بر اصل «استفاده‌ی منصفانه» تکیه دارد؛ اصلی که اجازه می‌دهد در شرایط مشخص از اثر دارای کپی‌رایت بدون اجازه استفاده شود. منتقدان می‌گویند این اصل برای استفاده‌ی تجاری در این مقیاس طراحی نشده است.

۶) چرا این پرونده فراتر از موسیقی است؟

اگر دادگاه به سود شاکیان رأی دهد، اثر آن به صنعت موسیقی محدود نمی‌ماند. همین پرسش درباره‌ی متن، تصویر، ویدئو و کد هم مطرح است: آیا آموزش یک مدل روی محتوای دارای کپی‌رایت، مصداق استفاده‌ی منصفانه است یا نقض حق؟

پاسخ روشن به این پرسش می‌تواند اقتصاد کل صنعت را تغییر دهد. در سناریوی سخت‌گیرانه، شرکت‌ها ناچار می‌شوند برای هر مجموعه‌داده مجوز بگیرند؛ کاری که هزینه‌ی ساخت مدل را به‌شدت بالا می‌برد و عملاً میدان را به بازیگران بزرگ محدود می‌کند.

در سناریوی مقابل، تثبیت استفاده‌ی منصفانه می‌تواند به معنای آن باشد که خالقان محتوا عملاً هیچ اهرمی برای مطالبه‌ی سهم نداشته باشند. هر دو سناریو پیامدهای جدی دارند و به همین دلیل این پرونده با دقت دنبال می‌شود. برای زمینه‌ی بیشتر می‌توانید تحلیل توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی را بخوانید.

جریمه احتمالی بیش از ۹ میلیارد دلار در پرونده سونی و یونیورسال علیه سونو

۷) نکته‌ی امنیتی: نشت داده‌ی کاربران

در سایه‌ی بحث کپی‌رایت، بخش امنیتی ماجرا کمتر دیده شده است. طبق گزارش‌ها، در این نفوذ به اطلاعات مشتریان شامل ایمیل، شماره تلفن و بخشی از اطلاعات کارت بانکی ذخیره‌شده در درگاه پرداخت هم دسترسی وجود داشته و کاربران در جریان قرار نگرفته‌اند.

اطلاع‌رسانی نکردن به کاربران پس از نشت داده، در بسیاری از حوزه‌های قضایی خودش یک تخلف جداگانه است. این بخش می‌تواند در آینده به پرونده‌های حقوقی مستقلی منجر شود.

درس عملی برای کاربران روشن است: برای سرویس‌های تازه از رمز عبور یکتا استفاده کنید، در صورت امکان احراز هویت دومرحله‌ای را فعال کنید و اطلاعات پرداخت را در سرویس‌هایی که استفاده‌ی مداوم ندارید ذخیره نکنید.

۸) این ماجرا برای کاربران سونو چه معنایی دارد؟

در کوتاه‌مدت، سرویس همچنان کار می‌کند و رأی دادگاه هنوز صادر نشده است. اما اگر شما از خروجی این ابزارها برای کار تجاری استفاده می‌کنید، باید حواستان به ریسک حقوقی باشد؛ به‌ویژه اگر خروجی شباهت محسوسی به اثر شناخته‌شده‌ای داشته باشد.

در میان‌مدت، احتمال دارد سرویس‌های موسیقی هوش مصنوعی به سمت مدل‌های دارای مجوز حرکت کنند. چند بازیگر بزرگ صنعت موسیقی پیش‌تر اعلام کرده‌اند که ترجیح می‌دهند به‌جای دعوای حقوقی، به توافق مجوزدهی برسند.

در بلندمدت، شفافیت درباره‌ی داده‌ی آموزشی احتمالاً به یک الزام تبدیل می‌شود، نه یک انتخاب. پیگیری این تحولات را می‌توانید در بخش اخبار هوش مصنوعی دنبال کنید و برای کار عملی با ابزارهای امروزی به آموزش‌های چت‌جی‌پی‌تی سر بزنید.

۹) تصویر بزرگ‌تر: پایان دوران «اول بساز، بعد توضیح بده»

سال‌های نخست موج هوش مصنوعی مولد با یک فرض ضمنی پیش رفت: اول مدل را بساز، بازار را بگیر و مسائل حقوقی را بعداً حل کن. این فرض تا وقتی جواب می‌داد که کسی نمی‌توانست ثابت کند دقیقاً چه چیزی وارد مدل شده است.

افشاگری سونو نشان می‌دهد آن دوران در حال پایان است. چه از راه نشت اطلاعات، چه از راه الزام قانونی به شفافیت، ترکیب داده‌ی آموزشی دیگر جعبه‌ی سیاه باقی نمی‌ماند.

برای شرکت‌های تازه‌وارد، پیام روشن است: هزینه‌ی مجوزدهی داده را از ابتدا در مدل مالی خود بگنجانند. مقاله‌ی اهمیت هوش مصنوعی در کسب‌وکار و تحلیل توهم هوش مصنوعی این تغییر نگاه را از زوایای دیگری بررسی می‌کنند.

پرسش‌های پرتکرار درباره‌ی نشت سورس‌کد سونو

سورس‌کد سونو چطور لو رفت؟

طبق گزارش‌ها، در نوامبر ۲۰۲۵ یک هکر با حمله‌ی زنجیره‌ی تأمین اعتبارنامه‌ی یکی از کارکنان را به دست آورد و از این راه به کد شرکت دسترسی پیدا کرد. محتوای آن در جولای ۲۰۲۶ منتشر شد.

چه حجمی از موسیقی در داده‌ی آموزشی بوده است؟

طبق فایل‌های گزارش‌شده، بیش از دو میلیون قطعه از یوتیوب موزیک و ده‌ها هزار ساعت صدا از دیزر، جینیوس، پاند فایو و کتابخانه‌ی پارتیتورها، به‌علاوه‌ی حدود ۴۲۰ هزار پادکست.

جریمه‌ی احتمالی چقدر است؟

در دامنه‌ی اولیه‌ی شکایت حدود ۸۴ میلیون دلار و در صورت پذیرش درخواست گسترش به بیش از ۶۱ هزار اثر، بیش از ۹ میلیارد دلار؛ به‌علاوه‌ی جریمه‌ی جداگانه برای هر مورد دور زدن حفاظت فنی.

پاسخ سونو چه بوده است؟

این شرکت گفته مدل‌هایش روی فایل‌های موسیقی در دسترس عموم آموزش دیده‌اند و کد افشاشده مربوط به نسخه‌ی قدیمی بوده است. دفاع حقوقی آن بر اصل استفاده‌ی منصفانه استوار است.

آیا این پرونده روی سایر ابزارهای هوش مصنوعی هم اثر می‌گذارد؟

بله. رأی این پرونده می‌تواند معیار قضایی تازه‌ای برای استفاده از محتوای دارای کپی‌رایت در آموزش مدل‌ها بسازد؛ معیاری که به متن، تصویر و ویدئو هم تسری پیدا می‌کند.

جمع‌بندی. افشای سورس‌کد سونو، نخستین‌بار است که ترکیب داده‌ی آموزشی یک سرویس بزرگ هوش مصنوعی با این سطح از جزئیات عمومی می‌شود. رأی دادگاه هرچه باشد، دوران پنهان‌ماندن منابع آموزشی رو به پایان است. برای پیگیری روزانه‌ی این پرونده به @MrChatGPT_IR بپیوندید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *