Black Forest发布FLUX 3 Image,支持4K分辨率与像素级多轮编辑
10月1日,德国AI公司Black Forest Labs正式开放FLUX 3 Image的API端点,把其多模态基座FLUX 3的图像能力推向商业可用。与常见的“一句话出图”不同,这款模型主打高可控与精细编辑:用户可以在归一化的0到1000坐标网格上,为画面中每个元素指定ID、描述与精确边界框,把对象摆到想放的位置,单次生成最多还能融入10张参考图像。

编辑能力是FLUX 3 Image的核心卖点。模型可以对指定区域做修改,同时保持画面其他像素完全不变,实现真正的像素级多轮编辑;官方称其能在不破坏原图内容的前提下,反复精修同一张图。输出分辨率覆盖从768平方像素到4K,且放大后仍保持丰富细节,面向的是商业级图像工作流,而非简单玩票。配套的API按分辨率定价,4K单张生成可能耗时数分钟,且返回图片仅可在一小时内下载。
FLUX 3本身并非单纯的图像模型。它在7月23日以早期访问形式亮相时,就是一个联合学习图像、视频与音频的统一架构,基于自监督流匹配框架Self-Flow,单次生成可输出最长20秒、带原生音频的视频。在训练算力的分配上,超过95%投向视频,图像能力更像是从这个“视频优先”的过程中继承而来;约十周后,图像模态作为计量API端点正式开放。Black Forest Labs表示,开源的模型骨干将在数周内发布。
从行业视角看,FLUX 3 Image延续了生成式AI从“惊艳demo”走向“可控生产工具”的趋势。精确的布局控制与多参考图合成,让它在电商、广告、设计等需要反复对齐需求的场景更有用;而按分辨率计费、开放权重在即的策略,则降低了企业试错门槛。对中文创作者而言,模型已能渲染多语言高精度文字,这意味着用中文提示词直接生成带排版的海报、封面也成为可能。随着多家图像模型在2026年密集迭代,谁能把“可控”与“低成本”同时做扎实,谁就更可能在商业落地中胜出。
读者评论 (4)
想参与讨论?请 登录 后发表评论。
坐标框编辑确实香,但限时下载这点太坑了,设计师正赶稿呢哪有时间盯着链接
限时一小时下载真的烦,做图人根本没空盯着链接,建议放个云端暂存
坐标框能精准摆物体确实香,但按分辨率计费还限时下载,这算不算给设计师加了一道“赶工”的坎?
这坐标框编辑太实用了,终于不用在生成后反复抽卡撞运气了