مدل هوش مصنوعی FLUX 3 از Black Forest Labs برای تولید ویدیو و صدا معرفی شد

FLUX 3 چیست؟ مدل هوش مصنوعی که ویدیو، صدا و رباتیک را یکجا می‌سازد

هوش مصنوعی · تولید محتوا

Black Forest Labs مدل چندوجهی FLUX 3 را معرفی کرد — یک معماری واحد برای ساخت ویدیوی ۲۰ ثانیه‌ای با صدا، تصویر و کنترل رباتیک که در ارزیابی‌های اولیه از Runway و Luma پیشی گرفته است.

چکیده. شرکت آلمانی Black Forest Labs در ۲۳ ژوئیه ۲۰۲۶ از مدل چندوجهی پرچمدار خود به نام FLUX 3 رونمایی کرد. این مدل قادر است ویدیوهای ۲۰ ثانیه‌ای با صدای همزمان، تصویر باکیفیت و دنباله‌های حرکتی رباتیک را از یک معماری واحد تولید کند. در ارزیابی‌های اولیه، FLUX 3 در ۷۷٪ مقایسه‌ها از Runway Gen-4.5 و در ۹۳٪ مقایسه‌ها از Luma Ray 3.2 بهتر عمل کرده است. نسخه رباتیک آن به نام FLUX-mimic اکنون توسط Audi در خط تولید آزمایش می‌شود.
مدل هوش مصنوعی FLUX 3 از Black Forest Labs برای تولید ویدیو و صدا معرفی شد

۱. FLUX 3 چیست؟ مروری بر بزرگ‌ترین انتشار هوش مصنوعی ژوئیه ۲۰۲۶

برای درک اهمیت FLUX 3 باید نگاهی به تاریخچه Black Forest Labs بیندازیم. این شرکت توسط گروهی از محققانی تأسیس شد که قبلاً مدل‌های Latent Diffusion و Stable Diffusion را ساخته بودند — همان مدل‌هایی که انقلاب تولید تصویر با هوش مصنوعی را رقم زدند. Black Forest Labs که در فرایبورگ آلمان و سان‌فرانسیسکو دفتر دارد، با یک تیم ۱۰۰ نفره و ارزش‌گذاری ۳.۲۵ میلیارد دلاری و سرمایه‌گذاری بیش از ۴۵۰ میلیون دلار، حالا قدم بعدی را برداشته است.

در ۲۳ ژوئیه ۲۰۲۶، این شرکت FLUX 3 را معرفی کرد؛ یک مدل چندوجهی که برخلاف رقبایش از یک معماری واحد برای تولید ویدیو، صدا، تصویر و دستورالعمل‌های حرکتی رباتیک استفاده می‌کند. این مدل بر پایه روش Self-Flow شرکت ساخته شده و ادعای بزرگی دارد: درک منسجم و یکپارچه از دنیای واقعی که می‌تواند به تولید محتوای رسانه‌ای و رباتیک به‌طور همزمان منجر شود. پیگیری آخرین اخبار هوش مصنوعی نشان می‌دهد که در کمتر از یک ماه، چندین مدل بزرگ در این حوزه منتشر شده‌اند، اما FLUX 3 با ادغام رباتیک در مدل تولید محتوا، رویکردی کاملاً متفاوت دارد.

۲. قابلیت‌های کلیدی: ویدیو با صدا، تصویر و دنباله حرکتی از یک پرامپت

مهم‌ترین نوآوری FLUX 3 این است که تولید ویدیو و صدا را در یک مدل واحد ادغام کرده است. FLUX 3 Video می‌تواند ویدیوهای ۲۰ ثانیه‌ای با صدای همزمان تولید کند — به این معنا که دیالوگ، جلوه‌های صوتی و صداهای محیطی در همان زمان ساخته می‌شوند که تصویر تولید می‌شود. این با رویکرد رقبا مثل Runway و Luma که معمولاً صدا را در مرحله‌ای جداگانه به ویدیو اضافه می‌کنند، تفاوت اساسی دارد.

۲.۱ ویدیو با صدای همزمان

یکی از نقاط قوت شناسایی‌شده FLUX 3 در ارزیابی‌های اولیه، توانایی آن در ضبط دقیق حالات چهره انسان است. بسیاری از مدل‌های فعلی تولید ویدیو در نمایش میکروبیان‌های صورت ضعف دارند. علاوه بر این، FLUX 3 توانسته صدا را به درستی با رویدادهای فیزیکی در ویدیو هماهنگ کند — مثلاً صدای شکستن شیشه دقیقاً با لحظه شکستن تصویر همزمان می‌شود. پشتیبانی چندزبانه این مدل هم از دیگر ویژگی‌های مثبت آن است که می‌تواند برای تولید محتوا به زبان‌های مختلف از جمله فارسی کاربرد داشته باشد.

۲.۲ تولید تصویر با FLUX 3 Image

FLUX 3 Image بخشی است که هنوز به صورت کامل عرضه نشده و در هفته‌های آینده به صورت تدریجی در اختیار کاربران قرار می‌گیرد. با توجه به کیفیت مدل‌های قبلی FLUX که در حوزه تولید تصویر جایگاه قابل توجهی داشتند، این بخش می‌تواند اهمیت زیادی پیدا کند. برای کسانی که می‌خواهند مهارت استفاده از این مدل‌ها را یاد بگیرند، راهنمای نوشتن پرامپت موثر می‌تواند نقطه شروع خوبی باشد.

۳. Self-Flow: معماری که همه چیز را یکپارچه می‌کند

روش Self-Flow که Black Forest Labs برای FLUX 3 از آن استفاده کرده، سنگ بنای این مدل است. در رویکردهای سنتی، مدل‌های تولید محتوا برای هر نوع خروجی (تصویر، ویدیو، صدا) به صورت جداگانه آموزش می‌بینند و سپس به هم متصل می‌شوند. Self-Flow با همسویی چندوجهی در یک پایپ‌لاین واحد، این جداسازی را حذف می‌کند.

به زبان ساده: یک پرامپت متنی واحد می‌تواند هم ویدیو، هم صدا و هم دنباله‌های حرکتی رباتیک تولید کند زیرا مدل «درکی مشترک» از این‌ها دارد. این شبیه به این است که به یک هنرمند بگویید هم نقاشی بکش، هم موسیقی بنواز — نه اینکه دو متخصص جدا داشته باشید. نتیجه این یکپارچگی، انسجام بیشتر بین اجزای مختلف خروجی است. برای درک بهتر اینکه هوش مصنوعی واقعاً چه توانایی‌هایی دارد و چه محدودیت‌هایی، مطالعه مقاله تخصصی ما توصیه می‌شود.

مقایسه FLUX 3 با Runway Gen-4.5 و Luma Ray 3.2 در ارزیابی تولید ویدیو

۴. مقایسه با رقبا: Runway و Luma چقدر عقب ماندند؟

اعداد ارائه‌شده توسط Black Forest Labs برای مقایسه با رقبا چشمگیر هستند: FLUX 3 در ۷۷٪ مقایسه‌ها از Runway Gen-4.5 بهتر بوده و در ۹۳٪ مقایسه‌ها از Luma Ray 3.2 پیشی گرفته است. این ارزیابی‌های اولیه بر اساس معیارهایی مثل کیفیت کلی ویدیو، دقت حالات چهره، هماهنگی صدا با تصویر و حفظ انسجام در طول زمان انجام شده‌اند.

البته باید احتیاط کرد: این ارزیابی‌ها توسط خود شرکت انجام شده و Black Forest Labs اعلام کرده که نتایج کامل و متدولوژی دقیق بنچمارک را همزمان با عرضه عمومی‌تر منتشر خواهد کرد. Runway و Luma هنوز واکنشی نشان نداده‌اند. با این حال، وقتی شرکایی مثل Canva — که با بزرگ‌ترین مدل‌های دنیا کار کرده — محصول را انتخاب می‌کنند، این می‌تواند سیگنال مثبتی باشد. برای مقایسه بهتر بین مدل‌های مختلف هوش مصنوعی، مقاله مقایسه ChatGPT و DeepSeek دیدگاه خوبی ارائه می‌دهد.

در سطح صنعتی، اگر این ادعاها تأیید شوند، Runway و Luma با فشار جدی روبرو می‌شوند. Runway در سال‌های اخیر با Gen-3 و Gen-4.5 خود جایگاه پیشرویی را کسب کرده بود و Luma با Ray 3.2 رقیب سرسختی بود. اما ادغام صدا و رباتیک در یک مدل واحد، بازی را به سطح دیگری می‌برد که این دو رقیب هنوز آن را ارائه نداده‌اند.

۵. FLUX-mimic: وقتی هوش مصنوعی تولید محتوا وارد کارخانه می‌شود

احتمالاً بلندپروازانه‌ترین بخش FLUX 3، نسخه رباتیک آن به نام FLUX-mimic است. این مدل با همان معماری Self-Flow پایه FLUX 3 ساخته شده اما برای پیش‌بینی حرکت فیزیکی ربات‌ها بهینه‌سازی شده است. به جای تولید ویدیو، FLUX-mimic «دنباله‌های اکشن» تولید می‌کند — یعنی توالی دقیقی از حرکات که یک ربات باید اجرا کند تا یک وظیفه خاص را انجام دهد.

آنچه FLUX-mimic را در مقایسه با راه‌حل‌های رباتیک فعلی متمایز می‌کند، سرعت آموزش آن است. برای تنظیم دقیق این مدل برای یک وظیفه خاص، تنها ۳۰ دقیقه داده رباتیک کافی است — در حالی که رویکردهای قبلی معمولاً به ۳۰ ساعت یا بیشتر داده نیاز داشتند. این کاهش صد برابری در نیاز به داده می‌تواند استقرار رباتیک مبتنی بر هوش مصنوعی را در صنایع مختلف به طرز چشمگیری ارزان‌تر و سریع‌تر کند. اهمیت هوش مصنوعی در کسب‌وکارهای مدرن دقیقاً در همین نوع نوآوری‌ها نهفته است.

۶. Audi و کاربرد صنعتی: رباتیک هوشمند در خط تولید خودرو

Audi به عنوان اولین شرکت‌کننده بزرگ صنعتی در آزمایش FLUX-mimic معرفی شده است. این غول خودروسازی آلمانی دارد این مدل را برای وظیفه خاصی آزمایش می‌کند: نصب درزگیر درب خودرو. این وظیفه که به نظر ساده می‌رسد، در واقع یکی از چالش‌برانگیزترین کارها برای ربات‌های صنعتی است زیرا نیاز به دقت بالا در دستکاری اجسام نرم دارد — بر خلاف کارهایی مثل جوشکاری یا پیچ‌کاری که با اجسام سخت سر و کار دارند.

اگر این آزمایش موفق باشد، می‌تواند راه را برای استفاده گسترده‌تر از FLUX-mimic در خطوط تولید خودرو باز کند. تصور کنید که به جای آموزش هفته‌ها یا ماه‌ها به یک ربات صنعتی برای یاد گرفتن یک کار جدید، تنها با ۳۰ دقیقه نمایش انسانی بتوان ربات را آموزش داد. این می‌تواند انعطاف‌پذیری خطوط تولید را به طور اساسی تغییر دهد.

FLUX-mimic مدل رباتیک Black Forest Labs در خط تولید Audi آزمایش می‌شود

۷. شرکای فناوری و دسترسی اولیه به FLUX 3

Black Forest Labs اعلام کرده که چند شرکت فناوری شناخته‌شده در آزمایش اولیه FLUX 3 شرکت داشته‌اند: Canva (پلتفرم طراحی گرافیک)، Burda (گروه رسانه‌ای آلمانی)، Magnific (ابزار بهبود تصویر)، Krea (پلتفرم خلاقیت هوش مصنوعی) و Picsart (برنامه ویرایش عکس). این فهرست جالب است زیرا طیف وسیعی از کاربردها — از طراحی گرافیک تا رسانه و ویرایش عکس — را پوشش می‌دهد.

حضور Canva در این فهرست اهمیت ویژه‌ای دارد. Canva با صدها میلیون کاربر، یکی از بزرگ‌ترین پلتفرم‌های طراحی در جهان است و با مدل‌های مختلف هوش مصنوعی کار کرده است. انتخاب FLUX 3 توسط Canva می‌تواند نشانه خوبی از کیفیت واقعی این مدل باشد. درک واقعی از اینکه هوش مصنوعی چطور در کار حرفه‌ای به کار می‌رود به مخاطبان کمک می‌کند تا این نوع اخبار را بهتر ارزیابی کنند.

۸. دسترسی به FLUX 3: کِی و چطور می‌توان از آن استفاده کرد؟

در حال حاضر، دسترسی به FLUX 3 Video و FLUX-mimic از طریق API و وزن‌های خصوصی، در قالب دسترسی اولیه (Early Access) و برای توسعه‌دهندگان امکان‌پذیر است. برای دسترسی باید از طریق وب‌سایت Black Forest Labs درخواست دهید. قیمت‌گذاری هنوز اعلام نشده است.

FLUX 3 Image که قابلیت تولید تصویر است، در هفته‌های آینده به صورت تدریجی عرضه می‌شود و انتظار می‌رود دسترسی عمومی‌تری داشته باشد. Black Forest Labs همچنین قول داده که نسخه‌های open-weight سریع‌تر از FLUX 3 در اواخر سال ۲۰۲۶ منتشر شوند. این نسخه‌های open-weight می‌توانند به توسعه‌دهندگان اجازه دهند که مدل را به صورت محلی اجرا کنند و تغییرات خود را اعمال کنند — درست مثل آنچه با مدل‌های قبلی FLUX انجام دادند. برای آشنایی با مدل‌های مشابه و آموزش استفاده از ابزارهای هوش مصنوعی، منابع آموزشی موجود در سایت ما می‌توانند مفید باشند.

۹. تأثیر FLUX 3 بر صنعت تولید محتوا و خلاقیت دیجیتال

اگر ادعاهای Black Forest Labs در ارزیابی‌های مستقل تأیید شوند، FLUX 3 می‌تواند تأثیرات گسترده‌ای بر صنعت تولید محتوای دیجیتال داشته باشد. تولیدکنندگان محتوا، فیلم‌سازان مستقل، استودیوهای بازی و تیم‌های بازاریابی همگی می‌توانند از ویدیوهای باکیفیت با صدای همزمان بهره‌مند شوند — بدون اینکه مجبور باشند برای هر بخش ابزار جداگانه‌ای یاد بگیرند و پول بدهند.

از منظر کسب‌وکار، اخبار هوش مصنوعی در ماه‌های اخیر نشان می‌دهد که سرعت پیشرفت مدل‌های تولید محتوا به حدی رسیده که شرکت‌های بزرگ مثل Runway و Luma نمی‌توانند تنها به کیفیت تولید ویدیو تکیه کنند — باید اکوسیستم کامل‌تری ارائه دهند. FLUX 3 با ادغام صدا، تصویر و رباتیک، این چالش را به وضوح به نمایش گذاشته است. درک عمیق‌تر از بازیگران اصلی صنعت هوش مصنوعی کمک می‌کند تا تأثیر این نوع رقابت‌ها را بهتر بسنجیم.

۱۰. سوالات متداول درباره FLUX 3

FLUX 3 چه تفاوتی با Sora دارد؟

Sora مدل OpenAI است که بر تولید ویدیو تمرکز دارد. FLUX 3 علاوه بر ویدیو، صدای همزمان و رباتیک را هم در یک معماری واحد ادغام کرده — این اصلی‌ترین تمایز آن است. همچنین Black Forest Labs قصد دارد نسخه open-weight آن را عرضه کند که با رویکرد بسته OpenAI فرق دارد.

آیا FLUX 3 رایگان است؟

در حال حاضر قیمت‌گذاری اعلام نشده است. دسترسی اولیه از طریق درخواست برای توسعه‌دهندگان امکان‌پذیر است. نسخه open-weight که بعداً عرضه می‌شود احتمالاً رایگان خواهد بود.

FLUX-mimic برای چه مصارفی مناسب است؟

FLUX-mimic برای آموزش ربات‌ها به انجام دستکاری‌های فیزیکی طراحی شده است — مثل نصب قطعات، جابجایی اشیاء یا کارهای مونتاژ. مزیت اصلی آن نیاز کم به داده است: تنها ۳۰ دقیقه نمایش کافی است.

نسخه open-weight FLUX 3 کِی در دسترس خواهد بود؟

Black Forest Labs اعلام کرده که نسخه‌های open-weight سریع‌تر (Dev/Lite) در اواخر سال ۲۰۲۶ عرضه می‌شوند. تاریخ دقیق هنوز اعلام نشده است.

با FLUX 3 چطور ویدیو بسازم؟

در حال حاضر باید از طریق وب‌سایت Black Forest Labs برای دسترسی اولیه درخواست دهید. با عرضه عمومی‌تر در ماه‌های آینده، دسترسی از طریق شرکای پلتفرم مثل Canva و Krea هم امکان‌پذیر خواهد بود.

جمع‌بندی. FLUX 3 یکی از بلندپروازانه‌ترین انتشارهای هوش مصنوعی ژوئیه ۲۰۲۶ است. ادغام ویدیو، صدا، تصویر و رباتیک در یک معماری واحد، اگر با کیفیت ادعاشده به عموم عرضه شود، می‌تواند نقطه عطفی در صنعت تولید محتوای هوش مصنوعی باشد. ارزیابی‌های مستقل در هفته‌های آینده مشخص خواهند کرد که آیا Black Forest Labs واقعاً از Runway و Luma پیشی گرفته یا خیر. برای دنبال کردن این اخبار و آخرین رویدادهای هوش مصنوعی، کانال تلگرام ما را دنبال کنید: @MrChatGPT_IR

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

ورود | ثبت نام
شماره موبایل یا پست الکترونیک خود را وارد کنید

روش دریافت کد تایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
کد تایید را وارد کنید
کد تایید برای شماره موبایل شما ارسال گردید
کد تایید از طریق بازوی "رمز یکبار مصرف (OTP)" در پیام رسان بله برای شما ارسال شد"
برای دریافت کد تایید، شماره زیر را با موبایل خود به صورت کاملاً رایگان شماره گیری کنید"
تا لحظاتی دیگر برای اعلام کد تایید با شما تماس خواهیم گرفت
ارسال مجدد کد تا دیگر

روش دریافت کد تایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
رمز عبور را وارد کنید
رمز عبور حساب کاربری خود را وارد کنید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
درخواست بازیابی رمز عبور
لطفاً پست الکترونیک یا موبایل خود را وارد نمایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
کد تایید را وارد کنید
کد تایید برای شماره موبایل شما ارسال گردید
ارسال مجدد کد تا دیگر

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

ایمیل بازیابی ارسال شد!
لطفاً به صندوق الکترونیکی خود مراجعه کرده و بر روی لینک ارسال شده کلیک نمایید.

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

تغییر رمز عبور
یک رمز عبور برای اکانت خود تنظیم کنید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

تغییر رمز با موفقیت انجام شد

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

دریافت ۵۰ پرامپت برای سوالات پیچیده

دریافت فایل