阿里开源 Qwen-Image-2.1-Turbo,8步即可生成2K图像
10月9日,阿里巴巴通义千问团队发布开源图像模型 Qwen-Image-2.1-Turbo。这是 Qwen-Image-2.1 的加速检查点,核心改动只有一个:把扩散模型的去噪步数从基准版的40步压缩到8步,在同样的7B视觉生成架构上实现约5倍的速度提升,同时保持2K分辨率的图像生成与编辑能力。

从技术细节看,Turbo 并非新架构,而是把推荐的8步采样调度直接固化进权重。它沿用单流扩散 Transformer(DiT),32层、7B参数,文本编码器为 Qwen3-VL 8B,VAE 是支持原生透明通道(RGBA)的64通道自编码器。生成默认采用 CFG=1,并借助前缀 KV 缓存,在第一步算好文本与参考图的上下文后,后续步数直接复用,这正是8步仍能保持画质的关键。
能力覆盖上,Turbo 继承了基准版的八类输出:人像、人体姿态、透明图像、海报字体、UI 布局,以及单图变换、多参考合成、四图内景等编辑场景;基准版支持最多10张参考图与局部遮罩编辑,Turbo 全部保留。分辨率预设从2048×2048到2752×1536(16:9)。阿里云 Model Studio 以每张约0.10元(人民币)提供 API,权重遵循 Qwen 研究许可协议,商业自托管需单独申请。

对开发者的实际影响很直接:图像生成的延迟与算力成本主要由步数决定,8步意味着过去需要40步甚至更多才能跑完的推理,现在一轮即可完成,实时生成与高吞吐场景的门槛被明显压低。该版本已兼容 Diffusers 生态,可直接用 QwenImage21Pipeline 加载,无需额外适配即可接入现有工作流。
背景上,这延续了2026年国内外厂商压缩图像合成推理成本的共同趋势。在文生图从“能生成”转向“能低成本规模化落地”的阶段,步数蒸馏成为各家比拼的重点;阿里此举把开源2K图像生成的效率基准又往前推了一步,也为端侧与高并发应用留出更多空间。

读者评论 (0)
想参与讨论?请 登录 后发表评论。
还没有评论,欢迎抢沙发!