دسته · هوش مصنوعی
Black Forest Labs با FLUX 3 مرز میان مدلهای تولید ویدیو، صدا و تصویر را برداشت؛ حالا یک معماری واحد همه این کارها را با هم انجام میدهد — و این فقط شروع است.

لیست مطالب
۱. Black Forest Labs کیست؟
Black Forest Labs یک استارتاپ آلمانی است که توسط تیمی از محققان سابق Stability AI بنیانگذاری شده است. این شرکت با انتشار سری مدلهای FLUX در سال ۲۰۲۴ توجه دنیای هوش مصنوعی را به خود جلب کرد و بهسرعت به یکی از بازیگران اصلی حوزه تولید تصویر با هوش مصنوعی تبدیل شد.
FLUX 1 با کیفیت بینظیر در تولید تصویر و توجه دقیق به متن انگلیسی در تصاویر، نقطه عطفی در این صنعت بود. حالا FLUX 3 گامی بسیار بلندتر است؛ تحولی که از تصویر خارج میشود و وارد قلمروی ویدیو، صدا و حتی رباتیک میشود. برای درک بهتر این تحول، پیشنهاد میکنیم ابتدا مقاله OpenAI چیست؟ را بخوانید تا با اکوسیستم رقابتی این حوزه آشنا شوید.
۲. معماری Self-Flow؛ آموزش مشترک بهجای تخصص جداگانه
قلب تپنده FLUX 3 یک رویکرد آموزشی انقلابی است که Black Forest Labs آن را «Self-Flow» مینامد. در مدلهای سنتی، یک شبکه عصبی برای تولید تصویر، یک مدل دیگر برای ویدیو و مدل جداگانهای برای صدا آموزش میدید. این روش به چند مشکل اساسی منجر میشد: ناهماهنگی بین خروجیها، عدم یادگیری متقابل و پیچیدگی در بهروزرسانی.
FLUX 3 این رویکرد را بهکل کنار میگذارد. Robin Rombach، یکی از بنیانگذاران شرکت، اعلام کرده: «آموزش مشترک در یک معماری یکپارچه همان چیزی است که ما را به مقصد میرساند، زیرا هر مودالیته آموزشی، مودالیتههای دیگر را هم تقویت میکند.» به بیان ساده، وقتی مدل یاد میگیرد ویدیو با حرکت آب بسازد، همزمان درک بهتری از صدای آب و تصویر آب نیز پیدا میکند.
این معماری همان منطقی است که انسانها هم دارند: ما دنیا را نه بهعنوان تصاویر جدا یا صداهای مجزا، بلکه بهعنوان یک تجربه یکپارچه چندحسی درک میکنیم. FLUX 3 تلاش میکند همین یکپارچگی را به هوش مصنوعی بیاموزد. شما میتوانید درباره مفاهیم پایهتر در مقاله پتانسیل واقعی هوش مصنوعی بیشتر بخوانید.
۳. FLUX 3 Video؛ ویدیو و صدا در یک لحظه
پرکاربردترین قابلیت FLUX 3 در نسخه Video آن است. این سیستم میتواند ویدیوهایی با مدت ۲۰ ثانیه تولید کند که صدای آنها بهطور کامل با محتوای بصری همگام است — بدون نیاز به پردازش جداگانه یا ترکیب بعدی.
بر اساس ارزیابیهای اولیه که شرکت منتشر کرده، FLUX 3 Video در سه حوزه عملکرد برتری نسبت به رقبا داشته است:
- بازسازی دقیق حالات چهره: مدل میتواند احساسات ظریف را در ویدیو حفظ کند.
- تطابق صدا با رویدادهای فیزیکی: صدای قدمها، شکستن شیشه یا صدای باران دقیقاً با تصویر مطابقت دارد.
- پشتیبانی چندزبانه: توانایی پشتیبانی از زبانهای متعدد در صدای تولیدی.
این قابلیتها FLUX 3 را به ابزاری جدی برای تولید محتوا، آموزش الکترونیکی، صنعت بازی و سرگرمی تبدیل میکند. برای مقایسه با سایر ابزارهای هوش مصنوعی موجود در بازار، به بخش اخبار سایت ما مراجعه کنید.

۴. FLUX 3 Image؛ دقتی تازه در ویرایش بصری
نسخه Image این مدل چند هفته دیرتر از Video عرضه خواهد شد، اما وعدههای جالبی داده شده. بر خلاف FLUX 1 که عمدتاً روی تولید تصویر از صفر تمرکز داشت، FLUX 3 Image قابلیتهای پیشرفتهتری در ویرایش دقیق تصویر دارد.
با استفاده از یادگیری مشترک با ویدیو، این مدل درک عمیقتری از سازگاری حرکت در طول زمان به دست آورده — که این درک را به تصاویر ثابت هم منتقل میکند. نتیجه این است که تصاویر تولیدشده دارای انسجام داخلی بیشتری هستند و ویرایش انتخابی بدون بر هم زدن بقیه تصویر آسانتر میشود.
برای کسانی که میخواهند از این ابزارها در کار خود استفاده کنند، مقاله راهنمای نوشتن پرامپت برای مبتدیان میتواند نقطه شروع خوبی باشد.
۵. FLUX-mimic؛ انقلابی در آموزش رباتها
احتمالاً هیجانانگیزترین بخش FLUX 3، زیرمجموعهای است که «FLUX-mimic» یا «FLUX 3 Action» نامیده میشود. این سیستم با همکاری شرکت رباتیکسازی Mimic Robotics توسعه یافته و Audi آن را در خط تولید خود آزمایش کرده است.
مشکل اصلی رباتیک صنعتی تا به حال این بود که آموزش دادن یک ربات برای انجام وظیفهای جدید — مثلاً برداشتن یک قطعه با شکل خاص — ساعتها داده نیاز داشت. با FLUX-mimic، این زمان از ۳۰ ساعت به ۳۰ دقیقه کاهش یافته؛ یعنی ۶۰ برابر بهبود در کارایی.
این پیشرفت برای صنعت خودروسازی، الکترونیک و هر صنعتی که از رباتهای صنعتی استفاده میکند اهمیت زیادی دارد. هزینه پیادهسازی ربات میتواند بهطور قابل توجهی کاهش یابد. برای آشنایی با اثرات هوش مصنوعی بر کسبوکار، مقاله چرا هوش مصنوعی برای کسبوکار مهم است؟ را بخوانید.
۶. رقابت با Sora، Veo و Runway
FLUX 3 وارد میدانی میشود که بازیگران قدرتمندی در آن حضور دارند. OpenAI Sora یکی از اولین مدلهای تولید ویدیوی پیشرفته بود که توجه زیادی جلب کرد. Google Veo 3 هم مدعی است میتواند صدا و ویدیو را همگام تولید کند. Runway و Kling نیز در این فضا محصولات قوی دارند.
تفاوت اساسی FLUX 3 این است که بهجای تخصص در یک نوع خروجی، بهدنبال یکپارچگی واقعی است. Black Forest Labs ادعا میکند که در ارزیابیهای سربهسر، FLUX 3 Video برتری نشان داده — اما این ادعاها هنوز توسط منابع مستقل تأیید نشدهاند.
برای مقایسه دقیقتر مدلهای رقیب، میتوانید مقاله مقایسه مدلهای هوش مصنوعی را مطالعه کنید. همچنین در بخش آموزشهای ChatGPT ما درباره ابزارهای مختلف هوش مصنوعی بیشتر بیاموزید.

۷. دسترسی، عرضه و نقشه راه
در حال حاضر، FLUX 3 Video و FLUX 3 Action از ۲۳ ژوئیه ۲۰۲۶ از طریق API و وزنهای خصوصی در دسترس شرکای انتخابی قرار گرفتهاند. برای دسترسی عمومی، باید در لیست انتظار ثبتنام کرد.
FLUX 3 Image در هفتههای آینده بهصورت مرحلهای عرضه خواهد شد. برنامه مهمتر، انتشار نسخههای open-weight و سبکتر برای استقرار محلی تا پایان ۲۰۲۶ است — مشابه همان رویکردی که Black Forest Labs با FLUX 1 داشت و باعث گسترش سریع آن در جامعه توسعهدهندگان شد.
قیمتگذاری هنوز اعلام نشده، اما با توجه به رویکرد سابق این شرکت به قیمتگذاری رقابتی، انتظار میرود که مقرونبهصرفهتر از برخی رقبا باشد.
۸. تأثیر بر صنایع خلاق و تولید محتوا
FLUX 3 میتواند روند تولید محتوا را بهشکل اساسی تغییر دهد. یک تیم کوچک خلاق با این ابزار میتواند ویدیوهای حرفهای با صدای همزمان تولید کند — چیزی که قبلاً نیازمند چندین متخصص، نرمافزارهای گرانقیمت و ساعتها کار بود.
در حوزه آموزش الکترونیکی، FLUX 3 میتواند تولید محتوای آموزشی چندزبانه را سادهتر کند. در صنعت بازی، شخصیتپردازی و ساخت صحنه میتواند سریعتر پیش برود. در مارکتینگ، تولید تبلیغات ویدیویی شخصیسازیشده دیگر نیازمند بودجههای کلان نخواهد بود.
این تغییرات البته تبعاتی هم دارند. مشاغل مرتبط با ضبط صدا، طراحی جلوههای بصری و ویرایش ویدیو احتمالاً دستخوش تحول خواهند شد. برای بررسی عمیقتر این موضوع، مقاله توهم هوش مصنوعی در مقابل مهندس واقعی خواندنی است.
۹. نکات احتیاطی؛ آنچه هنوز مشخص نیست
با وجود تمام هیجان این معرفی، چند نکته مهم وجود دارد که باید در نظر گرفت. اول اینکه تمام ادعاهای عملکردی تاکنون از سوی خود Black Forest Labs بیان شدهاند و ارزیابی مستقل هنوز منتشر نشده است. در دنیای هوش مصنوعی، معرفیهای شرکتها همیشه با واقعیت استفاده روزمره تطابق کامل ندارند.
دوم، مسائل حقوقی و اخلاقی مرتبط با تولید ویدیو و صدا بسیار جدیتر از تصویر هستند. جعل هویت، تولید محتوای اشتباه و دیپفیکهای ویدیویی از چالشهایی هستند که این صنعت باید با آنها روبهرو شود. سومین نکته، مسئله قیمتگذاری است؛ تا زمانی که نرخهای دقیق اعلام نشود، نمیتوان در مورد قابلیت دسترسی واقعی این ابزار برای کسبوکارهای کوچک اظهار نظر کرد.
FAQ — پرسشهای رایج
FLUX 3 چه تفاوتی با Sora دارد؟
Sora عمدتاً یک مدل ویدیویی است. FLUX 3 یک معماری کاملاً یکپارچه دارد که ویدیو، صدا، تصویر و پیشبینی حرکت ربات را در یک مدل واحد ترکیب میکند و به همین دلیل هر مودالیته به تقویت دیگری کمک میکند.
آیا FLUX 3 رایگان است؟
در حال حاضر فقط از طریق دسترسی زودهنگام برای شرکای انتخابی در دسترس است. نسخه open-weight برای عموم تا پایان ۲۰۲۶ وعده داده شده، اما قیمتگذاری نسخه API هنوز اعلام نشده است.
FLUX-mimic چطور به رباتیک کمک میکند؟
FLUX-mimic میتواند با ۳۰ دقیقه داده آموزشی یک ربات را برای انجام وظایف جدید آموزش دهد — در مقایسه با ۳۰ ساعت در روشهای قبلی. این با همکاری Mimic Robotics توسعه یافته و توسط Audi آزمایش شده است.
آیا ایرانیها میتوانند از FLUX 3 استفاده کنند؟
در حال حاضر دسترسی محدود به شرکای انتخابی است. با عرضه نسخه open-weight تا پایان ۲۰۲۶، دسترسی از طریق ابزارهای واسطه ممکن خواهد شد — مشابه همان راهی که بسیاری از ایرانیان از FLUX 1 استفاده میکنند.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
