ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

革命性文本转图像模型Qwen-Image-Flash:四步极速生成高质量图像的完整指南

革命性文本转图像模型Qwen-Image-Flash:四步极速生成高质量图像的完整指南 革命性文本转图像模型Qwen-Image-Flash四步极速生成高质量图像的完整指南【免费下载链接】Qwen-Image-Flash项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Qwen-Image-FlashQwen-Image-Flash是由NVIDIA开发的革命性文本转图像模型它基于Qwen/Qwen-Image通过DMD2蒸馏技术优化而来仅需四步即可生成高质量图像。这款模型采用Diffusion TransformerMMDiT架构集成了Qwen2.5-VL文本编码器、Qwen分词器、60层Qwen-Image transformer、Qwen-Image VAE和FlowMatch Euler调度器为开发者和研究人员提供了高效的图像生成解决方案。 模型核心优势速度与质量的完美平衡Qwen-Image-Flash的最大亮点在于其四步极速生成能力。通过NVIDIA FastGen的DMD2技术、NVIDIA Model Optimizer和NVIDIA AutoModel进行蒸馏优化该模型在保持与基础模型相似架构的同时将图像生成步骤大幅减少极大提升了生成速度非常适合创意内容原型设计和对延迟敏感的图像生成工作流。模型总参数达到28.85B包含文本编码器和VAE其中去噪transformer拥有20.43B参数确保了生成图像的高质量。在1024×1024分辨率下Qwen-Image-Flash在Qwen-Image-Bench上获得47.080分在OneIG-Bench-EN上获得0.519分的优异成绩与基础模型相比性能接近但速度显著提升。 快速开始四步掌握图像生成1️⃣ 环境准备Qwen-Image-Flash支持多种运行时引擎包括Hugging Face Diffusers、SGLang Diffusion、vLLM-Omni和TensorRT-LLM VisualGen。推荐使用以下方式获取模型git clone https://gitcode.com/hf_mirrors/nvidia/Qwen-Image-Flash模型需要在NVIDIA GPU上运行推荐使用NVIDIA Hopper H100或Blackwell B200等架构的GPU以获得最佳性能。支持的操作系统为Linux建议使用指定的容器环境如vllm/vllm-omni:v0.24.0适用于Diffusers。2️⃣ 安装依赖以Diffusers为例需要安装以下依赖diffusers0.38.0transformers5.12.1torch支持bfloat16可以通过pip安装所需的Python包确保环境配置正确以支持GPU加速。3️⃣ 编写生成代码使用Diffusers库调用Qwen-Image-Flash非常简单以下是一个基本示例import torch from diffusers import QwenImagePipeline pipe QwenImagePipeline.from_pretrained( nvidia/Qwen-Image-Flash, torch_dtypetorch.bfloat16, ).to(cuda) image pipe( promptA red fox in a snowy pine forest at golden hour, photorealistic, sharp focus, soft bokeh, width1024, height1024, num_inference_steps4, true_cfg_scale1.0, guidance_scaleNone, negative_promptNone, generatortorch.Generator(devicecuda).manual_seed(42), ).images[0] image.save(qwen-image-flash-diffusers.png)4️⃣ 运行生成命令执行上述代码后模型将在四步推理后生成指定的图像。你也可以尝试使用其他引擎如SGLang Diffusion通过命令行直接生成图像docker run --rm --gpus all --ipchost --ulimit memlock-1 --ulimit stack67108864 -e HF_TOKEN -v qwen-image-hf-cache:/root/.cache/huggingface -v $PWD:/workspace -w /workspace lmsysorg/sglang:nightly-dev-cu13-20260721-8905cbd4 sglang generate --model-path nvidia/Qwen-Image-Flash --prompt A red fox in a snowy pine forest at golden hour, photorealistic, sharp focus, soft bokeh --width 1024 --height 1024 --num-inference-steps 4 --guidance-scale 1.0 --true-cfg-scale 1.0 --seed 42 --save-output --output-file-path qwen-image-flash-sglang.png⚙️ 高级配置与优化调整图像分辨率Qwen-Image-Flash默认输出1024×1024像素的图像。如果需要其他分辨率确保宽度和高度值能被16整除以避免自动调整大小影响图像质量。例如可以尝试512×512或768×768等分辨率。优化生成参数num_inference_steps固定为4这是模型优化的关键步骤数更改可能导致质量下降true_cfg_scale设置为1.0因为模型在蒸馏过程中已内化了分类器-free引导seed通过设置不同的随机种子可以生成同一提示的不同变体选择合适的运行时引擎根据你的应用场景选择最佳引擎Diffusers适合开发和集成到Python应用中SGLang Diffusion适合快速命令行测试和部署vLLM-Omni适合构建图像生成服务TensorRT-LLM提供最高性能适合大规模部署 模型架构解析Qwen-Image-Flash的完整 pipeline 包含以下关键组件文本编码器Qwen2.5-VL负责将文本提示转换为条件嵌入分词器Qwen tokenizer处理输入文本Transformer60层Qwen-Image transformer核心去噪网络VAEQwen-Image VAE将潜在空间转换为RGB图像调度器FlowMatch Euler scheduler配置为四步shift-3轨迹模型使用DMD2Distribution Matching Distillation技术进行训练在保留基础模型架构和参数数量的同时将推理步骤减少到四步实现了速度与质量的平衡。 使用注意事项适用场景Qwen-Image-Flash适用于创意内容原型设计低延迟图像生成工作流文本到图像生成研究不适用于图像编辑图像理解安全或生命关键决策许可证信息使用该模型受NVIDIA Open Model Agreement管辖同时遵循Apache License 2.0。模型可用于商业或非商业用途但需遵守相关许可条款。性能提示为获得最佳性能建议使用支持bfloat16的NVIDIA GPU确保输入提示为英文模型在蒸馏时使用英文标题保持批次大小适中避免内存溢出通过以上步骤你可以快速掌握Qwen-Image-Flash的使用方法利用其四步极速生成能力创建高质量图像。无论是开发创意应用还是进行相关研究这款模型都能为你提供高效、优质的文本转图像体验。【免费下载链接】Qwen-Image-Flash项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/Qwen-Image-Flash创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进