پرش به محتوای اصلی
بررسی و نقد

بررسی FLUX 3 Image؛ مدل تصویر Black Forest Labs ۲۰۲۶

Black Forest Labs روز ۱ اکتبر ۲۰۲۶ مدل تصویر FLUX 3 Image را با چیدمان کادر، تا ده مرجع و خروجی بومی تا کلاس ۴K منتشر کرد؛ ویرایش هدفمند را با احتیاط نسبت به ادعای پیکسل‌به‌پیکسل بررسی می‌کنیم.

۱۲ دقیقه مطالعه
اشتراک‌گذاری:
تصویر رسمی صفحهٔ محصول FLUX 3 Image در Black Forest Labs
تصویر رسمی صفحهٔ محصول FLUX 3 Image در Black Forest Labs
فهرست مطالب

FLUX 3 Image لایهٔ تصویر خانوادهٔ FLUX 3 شرکت Black Forest Labs است که روز ۱ اکتبر ۲۰۲۶ برای ساخت و ویرایش تصویر ثابت منتشر شد. ایدهٔ اصلی‌اش کنترل چیدمان است: می‌توانید با کادرهای محدودکننده (bounding box) بگویید هر عنصر کجای قاب بنشیند، تا ده تصویر مرجع بدهید، و در رزولوشن بومی ۲K و ۴K خروجی بگیرید. ویرایش چندمرحله‌ای را هم با شعار «پیکسل‌به‌پیکسل دقیق» تبلیغ می‌کنند؛ تست مستقل Creative AI News روی نمونه‌های خود شرکت نشان داده در عمل همیشه این‌قدر مطلق نیست. این مطلب بررسی نقش محصول است، نه امتیاز ستاره‌ای و نه بنچمارک آزمایشگاه خودمان.

صفحهٔ رسمی در bfl.ai/models/flux-3-image است. خانوادهٔ چندرسانه‌ای FLUX 3 را شرکت در ۲۳ ژوئیهٔ ۲۰۲۶ معرفی کرده بود؛ ویدئو و صدا لایه‌های جدا هستند و ساخت یک تصویر به‌تنهایی ویدئو تولید نمی‌کند. برای کسانی که ورک‌فلو گراف تصویر را روی ComfyUI جلو می‌برند، بررسی Comfy Agent هم در فناوری‌کده هست؛ FLUX 3 Image بیشتر مسیر میزبانی‌شدهٔ Playground و API است.

FLUX 3 Image چیست؟ پاسخ کوتاه

  • مدل ساخت و ویرایش تصویر ثابت از Black Forest Labs؛ بخش تصویر خانوادهٔ FLUX 3.

  • منتشرشده در ۱ اکتبر ۲۰۲۶؛ دموی رایگان در Playground و دسترسی API با نقطهٔ پایانی /v1/flux-3-image.

  • چیدمان با جدول عناصر و کادر روی شبکهٔ ۰ تا ۱۰۰۰؛ می‌شود از صفر ساخت یا فقط پرامپت نوشت.

  • تا ۱۰ تصویر مرجع در یک درخواست؛ خروجی کلاس‌های ۷۶۸ مربعی، ۱K، ۲K و حدود ۱۶ مگاپیکسل برای کلاس ۴K.

  • ویرایش هدفمند چند عنصر در یک درخواست؛ ادعا «پیکسل‌به‌پیکسل» است، ولی باید با احتیاط خوانده شود.

  • وزن تجاری برای اجرای خودمیزبان الان هست؛ وزن متن‌باز را «در هفته‌های آینده» وعده داده‌اند، بدون تاریخ قطعی.

  • قیمت پایهٔ هر تصویر (طبق سند قیمت و گزارش‌های هم‌زمان): حدود ۰٫۰۴۱ دلار در ۷۶۸ مربعی تا ۰٫۶۰۷ دلار در ۴K؛ Decoder از تخفیف ۵۰٪ API تا ۸ اکتبر ۲۰۲۶ خبر داده (پروموی لانچ؛ قبل از خرید چک کنید).

زمینه: مدل تصویر و کنترل چیدمان یعنی چه؟

مدل تصویر معمولی معمولاً یک متن می‌گیرد و یک قاب می‌سازد. اگر بگویید «عنوان سمت چپ باشد و شخص وسط»، مدل حدس می‌زند؛ گاهی درست درمی‌آید، گاهی نه. کنترل چیدمان یعنی شما فضای هر عنصر را از قبل مشخص می‌کنید: مثلاً یک کادر برای تیتر، یکی برای سوژه، یکی برای جمعیت پس‌زمینه. در FLUX 3 Image این کادرها روی یک شبکهٔ ۰ تا ۱۰۰۰ نوشته می‌شوند؛ نسبت تصویر هرچه باشد، همان شبکه روی بوم می‌نشیند.

ویرایش هدفمند هم همین منطق را دارد: به‌جای اینکه کل صحنه را از نو توصیف کنید، می‌گویید کدام بخش عوض شود و بقیه را «قفل» می‌کنید. شرکت می‌گوید پیکسل‌های بیرون کادر ویرایش معمولاً عین قبل می‌مانند. «معمولاً» کلمهٔ مهمی است؛ در بخش تست مستقل همان را باز می‌کنیم.

FLUX 3 را با «یک مدل همه‌کارهٔ ویدئو+تصویر» قاطی نکنید. پست ژوئیهٔ شرکت می‌گوید یک زیربنای چندرسانه‌ای است، ولی محصولی که اول اکتبر باز شده لایهٔ تصویر است. اگر ویدئو یا صدا می‌خواهید، مسیر جداست.

چطور کار می‌کند: از پرامپت ساده تا جدول کادرها

طبق صفحهٔ محصول و راهنماهای هم‌زمان، سه مسیر رایج دارید:

  • فقط متن. پرامپت می‌نویسید؛ مدل ترکیب‌بندی را خودش حدس می‌زند. برای ایدهٔ سریع و سبک‌های متنوع کافی است.

  • کادر + توضیح عنصر + یک خط صحنه. برای هر عنصر مهم یک باکس می‌کشید (یا در API جدول JSON می‌فرستید)، داخلش را توصیف می‌کنید، بعد یک جملهٔ کلی صحنه را می‌نویسید. مدل سعی می‌کند هر عنصر را داخل همان باکس بکشد.

  • مرجع‌ها. تا ده تصویر مرجع می‌دهید و در پرامپت با توکن‌هایی مثل ref_image_0 نقش هر کدام را می‌گویید: محصول از یکی، اتاق از یکی، نور از یکی.

ترتیب کادر در سند رسمی به‌صورت [بالا، چپ، پایین، راست] روی همان شبکه است. نکتهٔ مهم از خود مستندات: باکس‌ها راهنمای جایگذاری‌اند، نه ماسک برش سخت؛ عنصر ممکن است کمی از لبهٔ باکس بیرون بزند. پس بعد از تولید، باز هم باید قاب را چشم بزنید.

در مسیر عامل‌ها (agent)، شرکت می‌گوید می‌شود فقط یک خط پرامپت و نسبت تصویر داد تا یک مدل زبانی جدول کادر را برایتان بنویسد؛ بعد می‌توانید باکس‌ها را جابه‌جا کنید و دوباره تولید کنید. این برای پوستر، کلاژ و صحنه‌های شلوغ طراحی شده، نه فقط یک پرترهٔ ساده.

ویرایش چندمرحله‌ای و ادعای پیکسل‌به‌پیکسل

در نمونه‌های رسمی، چند کار همزمان دیده می‌شود: عوض کردن رنگ لباس و تخته‌موج، جابه‌جایی سوژه، یا جایگزینی یک نقاشی روی کاغذ، در حالی که بقیهٔ قاب باید سر جایش بماند. می‌توان چند عنصر را در یک درخواست بازتوصیف، جابه‌جا، یا حذف کرد و برای چیزهایی که نباید عوض شوند ردیف «لنگر» گذاشت.

شرکت این رفتار را ویرایش پیکسل‌به‌پیکسل می‌خواند و روی صفحهٔ خودش نمایشگر «پیکسل‌های تغییرکرده» گذاشته. Creative AI News همان نه نمونهٔ ویترینی را بدون هزینه بررسی کرده و امتیاز «پیکسل یکسان» خود BFL را بین حدود ۶۷٫۸٪ تا ۹۴٫۱٪ گزارش کرده؛ میانه حدود ۸۶٫۴٪. در سه نمونه از نه تا، بخش قابل‌توجهی از تغییرها دور از خود شیء ویرایش‌شده دیده شده. این نتیجهٔ آن رسانه است، نه آزمایشگاه فناوری‌کده. معنی عملی‌اش این است: برای یک پست شبکه‌های اجتماعی اغلب کافی است؛ برای پک‌شات برند، زنجیرهٔ ویرایش طولانی، یا لایه‌ای که باید پیکسل‌به‌پیکسل با فایل تأییدشده یکی بماند، یا باید خروجی را روی اصل کامپوزیت کنید یا مدل را تضمین مطلق ندانید.

رزولوشن، قیمت و دسترسی

خروجی بومی است؛ یعنی مدل همان قاب بزرگ را می‌سازد، نه اینکه اول کوچک بسازد و بعد بزرگنمایی کند. کلاس ۴K حدود ۱۶ مگاپیکسل است؛ نمونهٔ صفحهٔ محصول ۵۴۵۶ در ۳۰۷۲ پیکسل نشان داده شده. پس «۴K» اینجا لزوماً همان ۳۸۴۰×۲۱۶۰ ویدئو نیست.

قیمت پایهٔ هر تصویر که در یادداشت انتشار و صفحهٔ قیمت (به گزارش Nanobanana و Creative AI News، حدود ۳ اکتبر ۲۰۲۶) آمده:

  • ۷۶۸ مربعی: حدود ۰٫۰۴۱ دلار

  • حدود ۱ مگاپیکسل (۱K): حدود ۰٫۰۴۸ دلار

  • حدود ۴ مگاپیکسل (۲K): حدود ۰٫۱۰۰ دلار

  • حدود ۱۶ مگاپیکسل (۴K): حدود ۰٫۶۰۷ دلار

The Decoder نوشته تا ۸ اکتبر ۲۰۲۶ دسترسی API پنجاه درصد تخفیف دارد؛ این را پروموی لانچ بگیرید و قبل از بودجهٔ جدی، قیمت روز را از خود BFL بگیرید. Creative AI News می‌گوید از نظر هزینهٔ هر مگاپیکسل، ۲K اغلب به‌صرفه‌تر از ۴K است مگر جزئیاتی بخواهید که مدل بومی در قاب بزرگ بکشد.

API یک نقطهٔ پایانی دارد: پرامپت (و در صورت نیاز تصاویر) مشخص می‌کند کار ساخت است یا ویرایش؛ فیلد جداگانهٔ mode نیست. گزارش همان رسانه می‌گوید فیلدهای قدیمی مثل seed، width و input_image با خطای ۴۲۲ رد می‌شوند؛ یعنی اجرای تکراری با نتیجهٔ بیت‌به‌بیت یکسان تضمین نشده. لینک نتیجهٔ API معمولاً عمر کوتاه دارد (حدود یک ساعت در همان گزارش).

جدول مقایسهٔ نقش (بدون امتیاز جعلی)

فقط نقش رایج برای کار چیدمان و ویرایش، بر اساس سند BFL و گزارش‌های Ideogram ۴٫۵ و تجربهٔ عمومی Midjourney. نمرهٔ زیبایی یا سرعت نیست.

موضوع

FLUX 3 Image

Ideogram 4.5

Midjourney

نقطهٔ قوت رایج

چیدمان با کادر و چند مرجع؛ خروجی بومی تا کلاس ۴K

ویرایش دقیق با ماسک؛ متن داخل تصویر

زیبایی‌شناسی و گردش‌کار جامعهٔ کاربری

نشانهٔ محل ویرایش

ردیف باکس در پرامپت؛ لنگر برای بخش‌های ثابت

ماسک اختیاری (سیاه = ویرایش)

عمدتاً ورییشن، ریمیکس و ابزارهای داخل اکوسیستم خودش

تعداد مرجع

تا ۱۰

تا ۴ (ماسک یک اسلات می‌گیرد، طبق گزارش Creative AI News)

مرجع‌های سبک/کاراکتر در قواعد خودش؛ نه همان API باکس‌محور

سقف خروجی

حدود ۱۶ مگاپیکسل (کلاس ۴K)

پریست ۱K یا ۲K؛ Precise Edit اندازهٔ ورودی را نگه می‌دارد

بسته به طرح و نسخه؛ کنترل باکس ۰–۱۰۰۰ مثل BFL نیست

وزن متن‌باز

وعدهٔ هفته‌های آینده؛ تاریخ قطعی نیست

اعلام شده؛ تاریخ قطعی در همان پوشش‌ها نیست

مدل میزبان‌شدهٔ شرکت؛ وزن عمومی کامل مثل این مسیر نیست

برای چه کسی؟

پوستر، کلاژ، گرید محصول، زنجیرهٔ ویرایش با جای دقیق عناصر

ویرایش ماسک‌محور و کار متن‌دار با هزینهٔ پایین‌تر در تنظیمات ارزان

ایدهٔ بصری قوی و سبک ثابت بدون جدول مختصات

قوت‌ها و محدودیت‌ها

  • قوت: کنترل چیدمان با کادر برای کارهایی که «کجا» مهم‌تر از «تقریباً قشنگ» است؛ پوستر، جلد، پنل و صحنهٔ شلوغ.

  • قوت: تا ده مرجع در یک قاب، برای ترکیب محصول و فضا و سبک بدون اینکه همه چیز را در یک پرامپت درهم بریزید.

  • قوت: خروجی بومی ۲K و ۴K؛ جزئیات ریز مثل بافت و نوشتهٔ کوچک شانس بیشتری دارند تا در بزرگنمایی بعدازتولید ساخته شوند.

  • قوت: یک API برای ساخت و ویرایش؛ مناسب وصل شدن به عامل یا اسکریپت.

  • محدودیت: ادعای پیکسل‌به‌پیکسل مطلق نیست؛ تست مستقل روی نمونه‌های خود شرکت نشت تغییر را در بعضی قاب‌ها نشان داده.

  • محدودیت: نبود seed قابل اتکا (طبق گزارش Creative AI News) یعنی تکرار بیت‌به‌بیت سخت است؛ خروجی‌های خوب را همان لحظه ذخیره کنید.

  • محدودیت: وزن متن‌باز هنوز تاریخ دقیق ندارد؛ برای خودمیزبانی قطعی فعلاً مسیر تجاری است.

  • محدودیت: ۴K گران‌تر از ۲K است و همیشه لازم نیست؛ برای یادگیری ردیف باکس‌ها از رزولوشن پایین‌تر شروع کردن منطقی‌تر است.

  • محدودیت: رندر متن داخل تصویر هنوز نیاز به بازبینی املا و ترتیب خواندن دارد؛ پشتیبانی چندزبانه در راهنما آمده، ولی دقت در هر زبان و هر طول متن یکسان تضمین نشده.

برای چه کسی الان می‌ارزد؟

اگر گلوگاه‌تان کنترل و اصلاح بصری است—چیدن چند عنصر در یک قاب، ترکیب چند مرجع، یا عوض کردن یک تکه بدون از دست دادن کل صحنه—FLUX 3 Image ارزش امتحان این هفته را دارد؛ به‌خصوص اگر تخفیف لانچ API هنوز فعال باشد. طراح پوستر و کاور، تیم کمپین، و کسی که کاراکتر یا محصول تکراری دارد، سناریوی روشن دارند.

اگر فایل تأییدشدهٔ برند باید پیکسل‌به‌پیکسل دست‌نخورده بماند، یا زنجیرهٔ ویرایش طولانی می‌سازید، یا فقط دنبال یک قاب زیبا بدون مختصات هستید، Midjourney یا مسیر ماسک Ideogram ممکن است به انتظار روزمره‌تان نزدیک‌تر باشد—یا باید خروجی FLUX را خودتان روی اصل قفل کنید. وزن متن‌باز را هم فعلاً در برنامهٔ زمانی قطعی نگذارید.

جمع‌بندی

FLUX 3 Image وعده‌اش را روی کنترل می‌گذارد، نه فقط روی یک پرامپت خوش‌شانس. کادر، مرجع‌های زیاد، و رزولوشن بومی بالا همان چیزی است که صفحهٔ محصول نشان می‌دهد. ادعای ویرایش پیکسل‌به‌پیکسل را با گزارش Creative AI News کنار هم بگذارید: گاهی نزدیک است، گاهی اطراف شیء هم دوباره کشیده می‌شود. Ideogram ۴٫۵ رقیب هم‌زمان برای ویرایش محلی است؛ Midjourney هنوز برای سلیقه و گردش‌کار جامعه قوی است. شروع عملی: Playground برای یادگیری باکس‌ها، بعد API روی ۲K وقتی قاب نهایی را پیدا کردید، و ذخیرهٔ فوری هر خروجی که می‌خواهید نگه دارید.

پرسش‌های پرتکرار

FLUX 3 Image دقیقاً چیست؟

لایهٔ ساخت و ویرایش تصویر ثابت خانوادهٔ FLUX 3 از Black Forest Labs است. روز ۱ اکتبر ۲۰۲۶ از مسیر Playground و API در دسترس قرار گرفت. ویدئو و صدا محصول جدا در همان خانواده‌اند.

bounding box اینجا یعنی چه؟

یک کادر روی شبکهٔ ۰ تا ۱۰۰۰ که می‌گوید فلان عنصر تقریباً کجا و با چه فضایی قرار بگیرد. توضیح عنصر داخل همان کادر نوشته می‌شود و یک خط صحنه همه را به هم وصل می‌کند. باکس ماسک برش سخت نیست.

آیا ویرایش‌ها واقعاً پیکسل‌به‌پیکسل دست‌نخورده می‌مانند؟

شرکت می‌گوید بیرون کادر ویرایش معمولاً همان می‌ماند. تست مستقل Creative AI News روی نه نمونهٔ ویترینی BFL امتیاز پیکسل یکسان حدود ۶۷٫۸٪ تا ۹۴٫۱٪ گزارش کرده و در بعضی نمونه‌ها تغییر دور از شیء دیده. اگر پیکسل بیرون باکس باید ۱۰۰٪ یکی باشد، خروجی را روی فایل اصل کامپوزیت کنید.

چقدر هزینه دارد؟

قیمت پایهٔ اعلام‌شده حدود ۰٫۰۴۱ دلار برای ۷۶۸ مربعی، ۰٫۰۴۸ برای ۱K، ۰٫۱۰۰ برای ۲K و ۰٫۶۰۷ برای ۴K به ازای هر تصویر است. Decoder از تخفیف ۵۰٪ API تا ۸ اکتبر ۲۰۲۶ نوشته؛ قبل از خرید قیمت روز را چک کنید.

چند تصویر مرجع می‌توان داد؟

تا ده تصویر در یک درخواست، معمولاً با نام‌های ref_image_0 تا ref_image_9 در پرامپت. هر مرجع باید نقش مشخص داشته باشد، نه فقط «همه‌شان را قاطی کن».

آیا متن‌باز است؟

هنوز نه به‌صورت وزن عمومی. مجوز وزن تجاری برای اجرای خودمیزبان و فاین‌تیون الان هست؛ وزن باز را «در هفته‌های آینده» وعده داده‌اند بدون تاریخ دقیق.

با Midjourney یا Ideogram چه فرقی دارد؟

FLUX روی چیدمان با کادر و تعداد مرجع بالا و خروجی کلاس ۴K تأکید دارد. Ideogram ۴٫۵ ویرایش ماسک‌محور و مسیر ارزان‌تر در بعضی تنظیمات را جلو می‌گذارد. Midjourney بیشتر با سلیقه و ابزارهای اکوسیستم خودش شناخته می‌شود تا جدول مختصات API.

از کجا شروع کنم؟

از Playground رسمی BFL باکس بکشید و یک صحنهٔ ساده بسازید؛ بعد همان منطق را به API ببرید. برای یادگیری ردیف باکس‌ها از ۱K یا ۲K شروع کنید و فقط قاب نهایی را در ۴K بسازید اگر جزئیات بومی لازم است.

منابع

برچسب‌ها:هوش مصنوعیهوش مصنوعی مولدمدل زبانی بزرگ
اشتراک‌گذاری:

مطالب مرتبط

عضویت در خبرنامه

آخرین اخبار هوش مصنوعی و فناوری را در ایمیل خود دریافت کنید.

پس از عضویت یک ایمیل تأیید برایتان ارسال می‌شود. هر زمان می‌توانید اشتراک خود را لغو کنید و ایمیل شما با شخص ثالثی به اشتراک گذاشته نمی‌شود.