Black Forest Labs مدل چندوجهی FLUX 3 را معرفی کرد — یک معماری واحد برای ساخت ویدیوی ۲۰ ثانیهای با صدا، تصویر و کنترل رباتیک که در ارزیابیهای اولیه از Runway و Luma پیشی گرفته است.

لیست مطالب
۱. FLUX 3 چیست؟ مروری بر بزرگترین انتشار هوش مصنوعی ژوئیه ۲۰۲۶
برای درک اهمیت FLUX 3 باید نگاهی به تاریخچه Black Forest Labs بیندازیم. این شرکت توسط گروهی از محققانی تأسیس شد که قبلاً مدلهای Latent Diffusion و Stable Diffusion را ساخته بودند — همان مدلهایی که انقلاب تولید تصویر با هوش مصنوعی را رقم زدند. Black Forest Labs که در فرایبورگ آلمان و سانفرانسیسکو دفتر دارد، با یک تیم ۱۰۰ نفره و ارزشگذاری ۳.۲۵ میلیارد دلاری و سرمایهگذاری بیش از ۴۵۰ میلیون دلار، حالا قدم بعدی را برداشته است.
در ۲۳ ژوئیه ۲۰۲۶، این شرکت FLUX 3 را معرفی کرد؛ یک مدل چندوجهی که برخلاف رقبایش از یک معماری واحد برای تولید ویدیو، صدا، تصویر و دستورالعملهای حرکتی رباتیک استفاده میکند. این مدل بر پایه روش Self-Flow شرکت ساخته شده و ادعای بزرگی دارد: درک منسجم و یکپارچه از دنیای واقعی که میتواند به تولید محتوای رسانهای و رباتیک بهطور همزمان منجر شود. پیگیری آخرین اخبار هوش مصنوعی نشان میدهد که در کمتر از یک ماه، چندین مدل بزرگ در این حوزه منتشر شدهاند، اما FLUX 3 با ادغام رباتیک در مدل تولید محتوا، رویکردی کاملاً متفاوت دارد.
۲. قابلیتهای کلیدی: ویدیو با صدا، تصویر و دنباله حرکتی از یک پرامپت
مهمترین نوآوری FLUX 3 این است که تولید ویدیو و صدا را در یک مدل واحد ادغام کرده است. FLUX 3 Video میتواند ویدیوهای ۲۰ ثانیهای با صدای همزمان تولید کند — به این معنا که دیالوگ، جلوههای صوتی و صداهای محیطی در همان زمان ساخته میشوند که تصویر تولید میشود. این با رویکرد رقبا مثل Runway و Luma که معمولاً صدا را در مرحلهای جداگانه به ویدیو اضافه میکنند، تفاوت اساسی دارد.
۲.۱ ویدیو با صدای همزمان
یکی از نقاط قوت شناساییشده FLUX 3 در ارزیابیهای اولیه، توانایی آن در ضبط دقیق حالات چهره انسان است. بسیاری از مدلهای فعلی تولید ویدیو در نمایش میکروبیانهای صورت ضعف دارند. علاوه بر این، FLUX 3 توانسته صدا را به درستی با رویدادهای فیزیکی در ویدیو هماهنگ کند — مثلاً صدای شکستن شیشه دقیقاً با لحظه شکستن تصویر همزمان میشود. پشتیبانی چندزبانه این مدل هم از دیگر ویژگیهای مثبت آن است که میتواند برای تولید محتوا به زبانهای مختلف از جمله فارسی کاربرد داشته باشد.
۲.۲ تولید تصویر با FLUX 3 Image
FLUX 3 Image بخشی است که هنوز به صورت کامل عرضه نشده و در هفتههای آینده به صورت تدریجی در اختیار کاربران قرار میگیرد. با توجه به کیفیت مدلهای قبلی FLUX که در حوزه تولید تصویر جایگاه قابل توجهی داشتند، این بخش میتواند اهمیت زیادی پیدا کند. برای کسانی که میخواهند مهارت استفاده از این مدلها را یاد بگیرند، راهنمای نوشتن پرامپت موثر میتواند نقطه شروع خوبی باشد.
۳. Self-Flow: معماری که همه چیز را یکپارچه میکند
روش Self-Flow که Black Forest Labs برای FLUX 3 از آن استفاده کرده، سنگ بنای این مدل است. در رویکردهای سنتی، مدلهای تولید محتوا برای هر نوع خروجی (تصویر، ویدیو، صدا) به صورت جداگانه آموزش میبینند و سپس به هم متصل میشوند. Self-Flow با همسویی چندوجهی در یک پایپلاین واحد، این جداسازی را حذف میکند.
به زبان ساده: یک پرامپت متنی واحد میتواند هم ویدیو، هم صدا و هم دنبالههای حرکتی رباتیک تولید کند زیرا مدل «درکی مشترک» از اینها دارد. این شبیه به این است که به یک هنرمند بگویید هم نقاشی بکش، هم موسیقی بنواز — نه اینکه دو متخصص جدا داشته باشید. نتیجه این یکپارچگی، انسجام بیشتر بین اجزای مختلف خروجی است. برای درک بهتر اینکه هوش مصنوعی واقعاً چه تواناییهایی دارد و چه محدودیتهایی، مطالعه مقاله تخصصی ما توصیه میشود.

۴. مقایسه با رقبا: Runway و Luma چقدر عقب ماندند؟
اعداد ارائهشده توسط Black Forest Labs برای مقایسه با رقبا چشمگیر هستند: FLUX 3 در ۷۷٪ مقایسهها از Runway Gen-4.5 بهتر بوده و در ۹۳٪ مقایسهها از Luma Ray 3.2 پیشی گرفته است. این ارزیابیهای اولیه بر اساس معیارهایی مثل کیفیت کلی ویدیو، دقت حالات چهره، هماهنگی صدا با تصویر و حفظ انسجام در طول زمان انجام شدهاند.
البته باید احتیاط کرد: این ارزیابیها توسط خود شرکت انجام شده و Black Forest Labs اعلام کرده که نتایج کامل و متدولوژی دقیق بنچمارک را همزمان با عرضه عمومیتر منتشر خواهد کرد. Runway و Luma هنوز واکنشی نشان ندادهاند. با این حال، وقتی شرکایی مثل Canva — که با بزرگترین مدلهای دنیا کار کرده — محصول را انتخاب میکنند، این میتواند سیگنال مثبتی باشد. برای مقایسه بهتر بین مدلهای مختلف هوش مصنوعی، مقاله مقایسه ChatGPT و DeepSeek دیدگاه خوبی ارائه میدهد.
در سطح صنعتی، اگر این ادعاها تأیید شوند، Runway و Luma با فشار جدی روبرو میشوند. Runway در سالهای اخیر با Gen-3 و Gen-4.5 خود جایگاه پیشرویی را کسب کرده بود و Luma با Ray 3.2 رقیب سرسختی بود. اما ادغام صدا و رباتیک در یک مدل واحد، بازی را به سطح دیگری میبرد که این دو رقیب هنوز آن را ارائه ندادهاند.
۵. FLUX-mimic: وقتی هوش مصنوعی تولید محتوا وارد کارخانه میشود
احتمالاً بلندپروازانهترین بخش FLUX 3، نسخه رباتیک آن به نام FLUX-mimic است. این مدل با همان معماری Self-Flow پایه FLUX 3 ساخته شده اما برای پیشبینی حرکت فیزیکی رباتها بهینهسازی شده است. به جای تولید ویدیو، FLUX-mimic «دنبالههای اکشن» تولید میکند — یعنی توالی دقیقی از حرکات که یک ربات باید اجرا کند تا یک وظیفه خاص را انجام دهد.
آنچه FLUX-mimic را در مقایسه با راهحلهای رباتیک فعلی متمایز میکند، سرعت آموزش آن است. برای تنظیم دقیق این مدل برای یک وظیفه خاص، تنها ۳۰ دقیقه داده رباتیک کافی است — در حالی که رویکردهای قبلی معمولاً به ۳۰ ساعت یا بیشتر داده نیاز داشتند. این کاهش صد برابری در نیاز به داده میتواند استقرار رباتیک مبتنی بر هوش مصنوعی را در صنایع مختلف به طرز چشمگیری ارزانتر و سریعتر کند. اهمیت هوش مصنوعی در کسبوکارهای مدرن دقیقاً در همین نوع نوآوریها نهفته است.
۶. Audi و کاربرد صنعتی: رباتیک هوشمند در خط تولید خودرو
Audi به عنوان اولین شرکتکننده بزرگ صنعتی در آزمایش FLUX-mimic معرفی شده است. این غول خودروسازی آلمانی دارد این مدل را برای وظیفه خاصی آزمایش میکند: نصب درزگیر درب خودرو. این وظیفه که به نظر ساده میرسد، در واقع یکی از چالشبرانگیزترین کارها برای رباتهای صنعتی است زیرا نیاز به دقت بالا در دستکاری اجسام نرم دارد — بر خلاف کارهایی مثل جوشکاری یا پیچکاری که با اجسام سخت سر و کار دارند.
اگر این آزمایش موفق باشد، میتواند راه را برای استفاده گستردهتر از FLUX-mimic در خطوط تولید خودرو باز کند. تصور کنید که به جای آموزش هفتهها یا ماهها به یک ربات صنعتی برای یاد گرفتن یک کار جدید، تنها با ۳۰ دقیقه نمایش انسانی بتوان ربات را آموزش داد. این میتواند انعطافپذیری خطوط تولید را به طور اساسی تغییر دهد.

۷. شرکای فناوری و دسترسی اولیه به FLUX 3
Black Forest Labs اعلام کرده که چند شرکت فناوری شناختهشده در آزمایش اولیه FLUX 3 شرکت داشتهاند: Canva (پلتفرم طراحی گرافیک)، Burda (گروه رسانهای آلمانی)، Magnific (ابزار بهبود تصویر)، Krea (پلتفرم خلاقیت هوش مصنوعی) و Picsart (برنامه ویرایش عکس). این فهرست جالب است زیرا طیف وسیعی از کاربردها — از طراحی گرافیک تا رسانه و ویرایش عکس — را پوشش میدهد.
حضور Canva در این فهرست اهمیت ویژهای دارد. Canva با صدها میلیون کاربر، یکی از بزرگترین پلتفرمهای طراحی در جهان است و با مدلهای مختلف هوش مصنوعی کار کرده است. انتخاب FLUX 3 توسط Canva میتواند نشانه خوبی از کیفیت واقعی این مدل باشد. درک واقعی از اینکه هوش مصنوعی چطور در کار حرفهای به کار میرود به مخاطبان کمک میکند تا این نوع اخبار را بهتر ارزیابی کنند.
۸. دسترسی به FLUX 3: کِی و چطور میتوان از آن استفاده کرد؟
در حال حاضر، دسترسی به FLUX 3 Video و FLUX-mimic از طریق API و وزنهای خصوصی، در قالب دسترسی اولیه (Early Access) و برای توسعهدهندگان امکانپذیر است. برای دسترسی باید از طریق وبسایت Black Forest Labs درخواست دهید. قیمتگذاری هنوز اعلام نشده است.
FLUX 3 Image که قابلیت تولید تصویر است، در هفتههای آینده به صورت تدریجی عرضه میشود و انتظار میرود دسترسی عمومیتری داشته باشد. Black Forest Labs همچنین قول داده که نسخههای open-weight سریعتر از FLUX 3 در اواخر سال ۲۰۲۶ منتشر شوند. این نسخههای open-weight میتوانند به توسعهدهندگان اجازه دهند که مدل را به صورت محلی اجرا کنند و تغییرات خود را اعمال کنند — درست مثل آنچه با مدلهای قبلی FLUX انجام دادند. برای آشنایی با مدلهای مشابه و آموزش استفاده از ابزارهای هوش مصنوعی، منابع آموزشی موجود در سایت ما میتوانند مفید باشند.
۹. تأثیر FLUX 3 بر صنعت تولید محتوا و خلاقیت دیجیتال
اگر ادعاهای Black Forest Labs در ارزیابیهای مستقل تأیید شوند، FLUX 3 میتواند تأثیرات گستردهای بر صنعت تولید محتوای دیجیتال داشته باشد. تولیدکنندگان محتوا، فیلمسازان مستقل، استودیوهای بازی و تیمهای بازاریابی همگی میتوانند از ویدیوهای باکیفیت با صدای همزمان بهرهمند شوند — بدون اینکه مجبور باشند برای هر بخش ابزار جداگانهای یاد بگیرند و پول بدهند.
از منظر کسبوکار، اخبار هوش مصنوعی در ماههای اخیر نشان میدهد که سرعت پیشرفت مدلهای تولید محتوا به حدی رسیده که شرکتهای بزرگ مثل Runway و Luma نمیتوانند تنها به کیفیت تولید ویدیو تکیه کنند — باید اکوسیستم کاملتری ارائه دهند. FLUX 3 با ادغام صدا، تصویر و رباتیک، این چالش را به وضوح به نمایش گذاشته است. درک عمیقتر از بازیگران اصلی صنعت هوش مصنوعی کمک میکند تا تأثیر این نوع رقابتها را بهتر بسنجیم.
۱۰. سوالات متداول درباره FLUX 3
FLUX 3 چه تفاوتی با Sora دارد؟
Sora مدل OpenAI است که بر تولید ویدیو تمرکز دارد. FLUX 3 علاوه بر ویدیو، صدای همزمان و رباتیک را هم در یک معماری واحد ادغام کرده — این اصلیترین تمایز آن است. همچنین Black Forest Labs قصد دارد نسخه open-weight آن را عرضه کند که با رویکرد بسته OpenAI فرق دارد.
آیا FLUX 3 رایگان است؟
در حال حاضر قیمتگذاری اعلام نشده است. دسترسی اولیه از طریق درخواست برای توسعهدهندگان امکانپذیر است. نسخه open-weight که بعداً عرضه میشود احتمالاً رایگان خواهد بود.
FLUX-mimic برای چه مصارفی مناسب است؟
FLUX-mimic برای آموزش رباتها به انجام دستکاریهای فیزیکی طراحی شده است — مثل نصب قطعات، جابجایی اشیاء یا کارهای مونتاژ. مزیت اصلی آن نیاز کم به داده است: تنها ۳۰ دقیقه نمایش کافی است.
نسخه open-weight FLUX 3 کِی در دسترس خواهد بود؟
Black Forest Labs اعلام کرده که نسخههای open-weight سریعتر (Dev/Lite) در اواخر سال ۲۰۲۶ عرضه میشوند. تاریخ دقیق هنوز اعلام نشده است.
با FLUX 3 چطور ویدیو بسازم؟
در حال حاضر باید از طریق وبسایت Black Forest Labs برای دسترسی اولیه درخواست دهید. با عرضه عمومیتر در ماههای آینده، دسترسی از طریق شرکای پلتفرم مثل Canva و Krea هم امکانپذیر خواهد بود.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
