فهرست مطالب
FLUX 3 Image لایهٔ تصویر خانوادهٔ FLUX 3 شرکت Black Forest Labs است که روز ۱ اکتبر ۲۰۲۶ برای ساخت و ویرایش تصویر ثابت منتشر شد. ایدهٔ اصلیاش کنترل چیدمان است: میتوانید با کادرهای محدودکننده (bounding box) بگویید هر عنصر کجای قاب بنشیند، تا ده تصویر مرجع بدهید، و در رزولوشن بومی ۲K و ۴K خروجی بگیرید. ویرایش چندمرحلهای را هم با شعار «پیکسلبهپیکسل دقیق» تبلیغ میکنند؛ تست مستقل Creative AI News روی نمونههای خود شرکت نشان داده در عمل همیشه اینقدر مطلق نیست. این مطلب بررسی نقش محصول است، نه امتیاز ستارهای و نه بنچمارک آزمایشگاه خودمان.
صفحهٔ رسمی در bfl.ai/models/flux-3-image است. خانوادهٔ چندرسانهای FLUX 3 را شرکت در ۲۳ ژوئیهٔ ۲۰۲۶ معرفی کرده بود؛ ویدئو و صدا لایههای جدا هستند و ساخت یک تصویر بهتنهایی ویدئو تولید نمیکند. برای کسانی که ورکفلو گراف تصویر را روی ComfyUI جلو میبرند، بررسی Comfy Agent هم در فناوریکده هست؛ FLUX 3 Image بیشتر مسیر میزبانیشدهٔ Playground و API است.
FLUX 3 Image چیست؟ پاسخ کوتاه
مدل ساخت و ویرایش تصویر ثابت از Black Forest Labs؛ بخش تصویر خانوادهٔ FLUX 3.
منتشرشده در ۱ اکتبر ۲۰۲۶؛ دموی رایگان در Playground و دسترسی API با نقطهٔ پایانی /v1/flux-3-image.
چیدمان با جدول عناصر و کادر روی شبکهٔ ۰ تا ۱۰۰۰؛ میشود از صفر ساخت یا فقط پرامپت نوشت.
تا ۱۰ تصویر مرجع در یک درخواست؛ خروجی کلاسهای ۷۶۸ مربعی، ۱K، ۲K و حدود ۱۶ مگاپیکسل برای کلاس ۴K.
ویرایش هدفمند چند عنصر در یک درخواست؛ ادعا «پیکسلبهپیکسل» است، ولی باید با احتیاط خوانده شود.
وزن تجاری برای اجرای خودمیزبان الان هست؛ وزن متنباز را «در هفتههای آینده» وعده دادهاند، بدون تاریخ قطعی.
قیمت پایهٔ هر تصویر (طبق سند قیمت و گزارشهای همزمان): حدود ۰٫۰۴۱ دلار در ۷۶۸ مربعی تا ۰٫۶۰۷ دلار در ۴K؛ Decoder از تخفیف ۵۰٪ API تا ۸ اکتبر ۲۰۲۶ خبر داده (پروموی لانچ؛ قبل از خرید چک کنید).
زمینه: مدل تصویر و کنترل چیدمان یعنی چه؟
مدل تصویر معمولی معمولاً یک متن میگیرد و یک قاب میسازد. اگر بگویید «عنوان سمت چپ باشد و شخص وسط»، مدل حدس میزند؛ گاهی درست درمیآید، گاهی نه. کنترل چیدمان یعنی شما فضای هر عنصر را از قبل مشخص میکنید: مثلاً یک کادر برای تیتر، یکی برای سوژه، یکی برای جمعیت پسزمینه. در FLUX 3 Image این کادرها روی یک شبکهٔ ۰ تا ۱۰۰۰ نوشته میشوند؛ نسبت تصویر هرچه باشد، همان شبکه روی بوم مینشیند.
ویرایش هدفمند هم همین منطق را دارد: بهجای اینکه کل صحنه را از نو توصیف کنید، میگویید کدام بخش عوض شود و بقیه را «قفل» میکنید. شرکت میگوید پیکسلهای بیرون کادر ویرایش معمولاً عین قبل میمانند. «معمولاً» کلمهٔ مهمی است؛ در بخش تست مستقل همان را باز میکنیم.
FLUX 3 را با «یک مدل همهکارهٔ ویدئو+تصویر» قاطی نکنید. پست ژوئیهٔ شرکت میگوید یک زیربنای چندرسانهای است، ولی محصولی که اول اکتبر باز شده لایهٔ تصویر است. اگر ویدئو یا صدا میخواهید، مسیر جداست.
چطور کار میکند: از پرامپت ساده تا جدول کادرها
طبق صفحهٔ محصول و راهنماهای همزمان، سه مسیر رایج دارید:
فقط متن. پرامپت مینویسید؛ مدل ترکیببندی را خودش حدس میزند. برای ایدهٔ سریع و سبکهای متنوع کافی است.
کادر + توضیح عنصر + یک خط صحنه. برای هر عنصر مهم یک باکس میکشید (یا در API جدول JSON میفرستید)، داخلش را توصیف میکنید، بعد یک جملهٔ کلی صحنه را مینویسید. مدل سعی میکند هر عنصر را داخل همان باکس بکشد.
مرجعها. تا ده تصویر مرجع میدهید و در پرامپت با توکنهایی مثل ref_image_0 نقش هر کدام را میگویید: محصول از یکی، اتاق از یکی، نور از یکی.
ترتیب کادر در سند رسمی بهصورت [بالا، چپ، پایین، راست] روی همان شبکه است. نکتهٔ مهم از خود مستندات: باکسها راهنمای جایگذاریاند، نه ماسک برش سخت؛ عنصر ممکن است کمی از لبهٔ باکس بیرون بزند. پس بعد از تولید، باز هم باید قاب را چشم بزنید.
در مسیر عاملها (agent)، شرکت میگوید میشود فقط یک خط پرامپت و نسبت تصویر داد تا یک مدل زبانی جدول کادر را برایتان بنویسد؛ بعد میتوانید باکسها را جابهجا کنید و دوباره تولید کنید. این برای پوستر، کلاژ و صحنههای شلوغ طراحی شده، نه فقط یک پرترهٔ ساده.
ویرایش چندمرحلهای و ادعای پیکسلبهپیکسل
در نمونههای رسمی، چند کار همزمان دیده میشود: عوض کردن رنگ لباس و تختهموج، جابهجایی سوژه، یا جایگزینی یک نقاشی روی کاغذ، در حالی که بقیهٔ قاب باید سر جایش بماند. میتوان چند عنصر را در یک درخواست بازتوصیف، جابهجا، یا حذف کرد و برای چیزهایی که نباید عوض شوند ردیف «لنگر» گذاشت.
شرکت این رفتار را ویرایش پیکسلبهپیکسل میخواند و روی صفحهٔ خودش نمایشگر «پیکسلهای تغییرکرده» گذاشته. Creative AI News همان نه نمونهٔ ویترینی را بدون هزینه بررسی کرده و امتیاز «پیکسل یکسان» خود BFL را بین حدود ۶۷٫۸٪ تا ۹۴٫۱٪ گزارش کرده؛ میانه حدود ۸۶٫۴٪. در سه نمونه از نه تا، بخش قابلتوجهی از تغییرها دور از خود شیء ویرایششده دیده شده. این نتیجهٔ آن رسانه است، نه آزمایشگاه فناوریکده. معنی عملیاش این است: برای یک پست شبکههای اجتماعی اغلب کافی است؛ برای پکشات برند، زنجیرهٔ ویرایش طولانی، یا لایهای که باید پیکسلبهپیکسل با فایل تأییدشده یکی بماند، یا باید خروجی را روی اصل کامپوزیت کنید یا مدل را تضمین مطلق ندانید.
رزولوشن، قیمت و دسترسی
خروجی بومی است؛ یعنی مدل همان قاب بزرگ را میسازد، نه اینکه اول کوچک بسازد و بعد بزرگنمایی کند. کلاس ۴K حدود ۱۶ مگاپیکسل است؛ نمونهٔ صفحهٔ محصول ۵۴۵۶ در ۳۰۷۲ پیکسل نشان داده شده. پس «۴K» اینجا لزوماً همان ۳۸۴۰×۲۱۶۰ ویدئو نیست.
قیمت پایهٔ هر تصویر که در یادداشت انتشار و صفحهٔ قیمت (به گزارش Nanobanana و Creative AI News، حدود ۳ اکتبر ۲۰۲۶) آمده:
۷۶۸ مربعی: حدود ۰٫۰۴۱ دلار
حدود ۱ مگاپیکسل (۱K): حدود ۰٫۰۴۸ دلار
حدود ۴ مگاپیکسل (۲K): حدود ۰٫۱۰۰ دلار
حدود ۱۶ مگاپیکسل (۴K): حدود ۰٫۶۰۷ دلار
The Decoder نوشته تا ۸ اکتبر ۲۰۲۶ دسترسی API پنجاه درصد تخفیف دارد؛ این را پروموی لانچ بگیرید و قبل از بودجهٔ جدی، قیمت روز را از خود BFL بگیرید. Creative AI News میگوید از نظر هزینهٔ هر مگاپیکسل، ۲K اغلب بهصرفهتر از ۴K است مگر جزئیاتی بخواهید که مدل بومی در قاب بزرگ بکشد.
API یک نقطهٔ پایانی دارد: پرامپت (و در صورت نیاز تصاویر) مشخص میکند کار ساخت است یا ویرایش؛ فیلد جداگانهٔ mode نیست. گزارش همان رسانه میگوید فیلدهای قدیمی مثل seed، width و input_image با خطای ۴۲۲ رد میشوند؛ یعنی اجرای تکراری با نتیجهٔ بیتبهبیت یکسان تضمین نشده. لینک نتیجهٔ API معمولاً عمر کوتاه دارد (حدود یک ساعت در همان گزارش).
جدول مقایسهٔ نقش (بدون امتیاز جعلی)
فقط نقش رایج برای کار چیدمان و ویرایش، بر اساس سند BFL و گزارشهای Ideogram ۴٫۵ و تجربهٔ عمومی Midjourney. نمرهٔ زیبایی یا سرعت نیست.
موضوع | FLUX 3 Image | Ideogram 4.5 | Midjourney |
|---|---|---|---|
نقطهٔ قوت رایج | چیدمان با کادر و چند مرجع؛ خروجی بومی تا کلاس ۴K | ویرایش دقیق با ماسک؛ متن داخل تصویر | زیباییشناسی و گردشکار جامعهٔ کاربری |
نشانهٔ محل ویرایش | ردیف باکس در پرامپت؛ لنگر برای بخشهای ثابت | ماسک اختیاری (سیاه = ویرایش) | عمدتاً ورییشن، ریمیکس و ابزارهای داخل اکوسیستم خودش |
تعداد مرجع | تا ۱۰ | تا ۴ (ماسک یک اسلات میگیرد، طبق گزارش Creative AI News) | مرجعهای سبک/کاراکتر در قواعد خودش؛ نه همان API باکسمحور |
سقف خروجی | حدود ۱۶ مگاپیکسل (کلاس ۴K) | پریست ۱K یا ۲K؛ Precise Edit اندازهٔ ورودی را نگه میدارد | بسته به طرح و نسخه؛ کنترل باکس ۰–۱۰۰۰ مثل BFL نیست |
وزن متنباز | وعدهٔ هفتههای آینده؛ تاریخ قطعی نیست | اعلام شده؛ تاریخ قطعی در همان پوششها نیست | مدل میزبانشدهٔ شرکت؛ وزن عمومی کامل مثل این مسیر نیست |
برای چه کسی؟ | پوستر، کلاژ، گرید محصول، زنجیرهٔ ویرایش با جای دقیق عناصر | ویرایش ماسکمحور و کار متندار با هزینهٔ پایینتر در تنظیمات ارزان | ایدهٔ بصری قوی و سبک ثابت بدون جدول مختصات |
قوتها و محدودیتها
قوت: کنترل چیدمان با کادر برای کارهایی که «کجا» مهمتر از «تقریباً قشنگ» است؛ پوستر، جلد، پنل و صحنهٔ شلوغ.
قوت: تا ده مرجع در یک قاب، برای ترکیب محصول و فضا و سبک بدون اینکه همه چیز را در یک پرامپت درهم بریزید.
قوت: خروجی بومی ۲K و ۴K؛ جزئیات ریز مثل بافت و نوشتهٔ کوچک شانس بیشتری دارند تا در بزرگنمایی بعدازتولید ساخته شوند.
قوت: یک API برای ساخت و ویرایش؛ مناسب وصل شدن به عامل یا اسکریپت.
محدودیت: ادعای پیکسلبهپیکسل مطلق نیست؛ تست مستقل روی نمونههای خود شرکت نشت تغییر را در بعضی قابها نشان داده.
محدودیت: نبود seed قابل اتکا (طبق گزارش Creative AI News) یعنی تکرار بیتبهبیت سخت است؛ خروجیهای خوب را همان لحظه ذخیره کنید.
محدودیت: وزن متنباز هنوز تاریخ دقیق ندارد؛ برای خودمیزبانی قطعی فعلاً مسیر تجاری است.
محدودیت: ۴K گرانتر از ۲K است و همیشه لازم نیست؛ برای یادگیری ردیف باکسها از رزولوشن پایینتر شروع کردن منطقیتر است.
محدودیت: رندر متن داخل تصویر هنوز نیاز به بازبینی املا و ترتیب خواندن دارد؛ پشتیبانی چندزبانه در راهنما آمده، ولی دقت در هر زبان و هر طول متن یکسان تضمین نشده.
برای چه کسی الان میارزد؟
اگر گلوگاهتان کنترل و اصلاح بصری است—چیدن چند عنصر در یک قاب، ترکیب چند مرجع، یا عوض کردن یک تکه بدون از دست دادن کل صحنه—FLUX 3 Image ارزش امتحان این هفته را دارد؛ بهخصوص اگر تخفیف لانچ API هنوز فعال باشد. طراح پوستر و کاور، تیم کمپین، و کسی که کاراکتر یا محصول تکراری دارد، سناریوی روشن دارند.
اگر فایل تأییدشدهٔ برند باید پیکسلبهپیکسل دستنخورده بماند، یا زنجیرهٔ ویرایش طولانی میسازید، یا فقط دنبال یک قاب زیبا بدون مختصات هستید، Midjourney یا مسیر ماسک Ideogram ممکن است به انتظار روزمرهتان نزدیکتر باشد—یا باید خروجی FLUX را خودتان روی اصل قفل کنید. وزن متنباز را هم فعلاً در برنامهٔ زمانی قطعی نگذارید.
جمعبندی
FLUX 3 Image وعدهاش را روی کنترل میگذارد، نه فقط روی یک پرامپت خوششانس. کادر، مرجعهای زیاد، و رزولوشن بومی بالا همان چیزی است که صفحهٔ محصول نشان میدهد. ادعای ویرایش پیکسلبهپیکسل را با گزارش Creative AI News کنار هم بگذارید: گاهی نزدیک است، گاهی اطراف شیء هم دوباره کشیده میشود. Ideogram ۴٫۵ رقیب همزمان برای ویرایش محلی است؛ Midjourney هنوز برای سلیقه و گردشکار جامعه قوی است. شروع عملی: Playground برای یادگیری باکسها، بعد API روی ۲K وقتی قاب نهایی را پیدا کردید، و ذخیرهٔ فوری هر خروجی که میخواهید نگه دارید.
پرسشهای پرتکرار
FLUX 3 Image دقیقاً چیست؟
لایهٔ ساخت و ویرایش تصویر ثابت خانوادهٔ FLUX 3 از Black Forest Labs است. روز ۱ اکتبر ۲۰۲۶ از مسیر Playground و API در دسترس قرار گرفت. ویدئو و صدا محصول جدا در همان خانوادهاند.
bounding box اینجا یعنی چه؟
یک کادر روی شبکهٔ ۰ تا ۱۰۰۰ که میگوید فلان عنصر تقریباً کجا و با چه فضایی قرار بگیرد. توضیح عنصر داخل همان کادر نوشته میشود و یک خط صحنه همه را به هم وصل میکند. باکس ماسک برش سخت نیست.
آیا ویرایشها واقعاً پیکسلبهپیکسل دستنخورده میمانند؟
شرکت میگوید بیرون کادر ویرایش معمولاً همان میماند. تست مستقل Creative AI News روی نه نمونهٔ ویترینی BFL امتیاز پیکسل یکسان حدود ۶۷٫۸٪ تا ۹۴٫۱٪ گزارش کرده و در بعضی نمونهها تغییر دور از شیء دیده. اگر پیکسل بیرون باکس باید ۱۰۰٪ یکی باشد، خروجی را روی فایل اصل کامپوزیت کنید.
چقدر هزینه دارد؟
قیمت پایهٔ اعلامشده حدود ۰٫۰۴۱ دلار برای ۷۶۸ مربعی، ۰٫۰۴۸ برای ۱K، ۰٫۱۰۰ برای ۲K و ۰٫۶۰۷ برای ۴K به ازای هر تصویر است. Decoder از تخفیف ۵۰٪ API تا ۸ اکتبر ۲۰۲۶ نوشته؛ قبل از خرید قیمت روز را چک کنید.
چند تصویر مرجع میتوان داد؟
تا ده تصویر در یک درخواست، معمولاً با نامهای ref_image_0 تا ref_image_9 در پرامپت. هر مرجع باید نقش مشخص داشته باشد، نه فقط «همهشان را قاطی کن».
آیا متنباز است؟
هنوز نه بهصورت وزن عمومی. مجوز وزن تجاری برای اجرای خودمیزبان و فاینتیون الان هست؛ وزن باز را «در هفتههای آینده» وعده دادهاند بدون تاریخ دقیق.
با Midjourney یا Ideogram چه فرقی دارد؟
FLUX روی چیدمان با کادر و تعداد مرجع بالا و خروجی کلاس ۴K تأکید دارد. Ideogram ۴٫۵ ویرایش ماسکمحور و مسیر ارزانتر در بعضی تنظیمات را جلو میگذارد. Midjourney بیشتر با سلیقه و ابزارهای اکوسیستم خودش شناخته میشود تا جدول مختصات API.
از کجا شروع کنم؟
از Playground رسمی BFL باکس بکشید و یک صحنهٔ ساده بسازید؛ بعد همان منطق را به API ببرید. برای یادگیری ردیف باکسها از ۱K یا ۲K شروع کنید و فقط قاب نهایی را در ۴K بسازید اگر جزئیات بومی لازم است.
منابع
صفحهٔ محصول FLUX 3 Image — Black Forest Labs
پست خانوادهٔ FLUX 3 — Black Forest Labs، ۲۳ ژوئیهٔ ۲۰۲۶
گزارش The Decoder — ۲ اکتبر ۲۰۲۶
مرور قابلیتها — Nanobanana، ۲ اکتبر ۲۰۲۶
تست پیکسلبهپیکسل — Creative AI News، ۱ اکتبر ۲۰۲۶ (مستقل؛ نه آزمایشگاه فناوریکده)



