AI 绘画模型怎么选、提示词怎么写
AI 绘画模型怎么选、提示词怎么写
过去几年 AI 绘画的入门问题是「SD 1.5、SDXL、FLUX 选哪个」。这个框架现在已经不成立了——那三者都是同一条路线(本地部署的开源模型)上的不同代际,而今天真正的分岔在更前面一步。
一、第一刀:云端直出,还是本地部署
先回答这个,再谈模型。
| 云端直出 | 本地部署 | |
|---|---|---|
| 代表 | GPT Image、Nano Banana、Seedream、即梦、万相、可灵 | FLUX.2、Qwen-Image、Z-Image、SDXL 生态 |
| 画质与文字渲染 | 明显领先,中文排版可用 | 追赶中,顶级模型显存门槛高 |
| 成本 | 按张计费,国内主流约 0.1~0.5 元/张,多数有免费额度 | 电费,出图无限 |
| 门槛 | 打开网页就能用 | 装环境、下模型、调参数 |
| 自由度 | 有内容审核,多数强制水印 | 完全自由,可加载自训模型/LoRA |
大多数人应该用云端。本地部署真正不可替代的场景只有四个:要无限量出图、要离线、要用社区的特定画风模型(LoRA),或者不希望内容经过审核。如果你不属于这四类,折腾本地的时间成本远高于买几百张云端出图。
提示
国内可直接用的云端入口门槛都很低:夸克 AI 搜索免登录就能出图;豆包、即梦、千问创作平台、腾讯元宝都内置生图。想按张调 API 的话,各家单价大致在 0.1~0.5 元区间。
二、本地部署:按显存对号入座
如果确定要本地跑,显存是唯一的硬约束,先看你的显卡能跑什么,再谈模型好坏。
需要先理解一件事:出图要加载的不只是主模型,还有一个体积相当可观的文本编码器。好在 ComfyUI 会在文本编码完成后把编码器换出内存,所以峰值显存约等于「两者中较大的那个」,而不是简单相加——但硬盘上两份都得下。
| 显存 | 现实可行的选择 |
|---|---|
| 8GB | FLUX.2-klein 4B(量化版)、Z-Image-Turbo(Q4)、SDXL 生态 |
| 12GB | 上面全部 + FLUX.1-dev(Q6 量化)、FLUX.2-klein 9B(量化) |
| 16GB | + Qwen-Image(Q4 量化)、Z-Image 原生精度、FLUX.2-klein 9B 官方 fp8 |
| 24GB | + Qwen-Image 官方 fp8 方案、FLUX.2-dev(需 4bit 量化) |
几个值得单独说明的点:
- FLUX.2-klein 4B 是目前低显存的最优解。官方口径有出入:GitHub 说约 8GB,模型卡说约 13GB,ComfyUI 实测蒸馏版 8.4GB。8GB 卡建议直接走量化版(主模型 2.6~4.3GB)稳妥。
- Z-Image-Turbo(阿里通义,6B,Apache-2.0 可商用)官方明说「16GB 消费级显卡可跑」,量化后 8GB 也有戏,是性价比很高的新选择。
- FLUX.2-dev 不是消费级方案。它 32B,且文本编码器换成了 Mistral-Small 24B——光编码器 bf16 就 35GB。官方最低口径是 24~32GB 显存配 4bit 量化。
- Qwen-Image 系列(阿里)在中文社区使用面很广,图像编辑版本尤其活跃。24GB 卡跑官方 fp8 方案,ComfyUI 实测占用约 20.6GB。
注
ComfyUI 核心至今不原生支持 GGUF 格式,加载量化模型需要另装 city96 的 ComfyUI-GGUF 自定义节点。官方自己的低显存路线是 fp8 / int8 等原生量化格式。
本页讲的是「选什么」。具体怎么装、怎么跑,见博客的实战长文,含完整截图与踩坑记录:ComfyUI 节点式工作流(当前主力)· Stable Diffusion 进阶插件。
三、SDXL 生态:模型冻结,但生态还活着
Illustrious、NoobAI、Pony V6、Animagine 这几个 SDXL 衍生基座,本体全部停止迭代(最后的实质更新集中在 2024 年底到 2025 年中),原班团队也大多转向了非 SDXL 架构。
但这不代表它们没用了——Civitai 上以这些基座为底的 LoRA 至今每天都有新上传。如果你的目标是特定画风或角色,SDXL 生态的存量素材依然是最丰富的,而且显存友好。
注意
LoRA 必须与基座架构匹配,这条规则没有变,而且至今没有任何可用的跨基座转换方案。SD 1.5 的 LoRA 不能用在 SDXL 上,SDXL 的也不能用在 FLUX 或 Qwen-Image 上。学术界有几篇跨架构迁移的论文,但全是研究原型;商业平台的官方口径是「不同家族互不通用,唯一路径是拿原数据集重新训练」。
四、提示词:从标签串到自然语言
这是新老模型之间最大的写法差异。
老一代(SD 1.5 / SDXL)吃的是标签串:1girl, white dress, masterpiece, best quality。新一代模型(FLUX.2、Qwen-Image、Z-Image、以及所有云端模型)用 LLM 做文本编码器,吃的是自然语言整句。
Black Forest Labs 官方指南的说法很直接:「用散文写,不要写关键词列表——像小说家那样描述场景。」阿里 Qwen 官方的提示词改写器里也明确要求「使用流畅、自然的描述性语言,禁止使用列表、编号、标题或任何结构化格式」——因为模型的训练数据本身就是自然语言描述,标签串与训练分布不匹配。
对照一下:
- 老写法:
1girl, white dress, sunflower field, soft light, masterpiece, best quality - 新写法:
一个穿白色连衣裙的女孩站在向日葵田里,午后柔和的侧光洒在她的肩膀上,背景虚化
几条仍然有效的通用技巧
- 光线描述性价比最高。BFL 官方明确指出「光线描述对成图质量的单项影响最大」。
- 要出文字就用引号包起来。字节、Qwen、腾讯、智谱四家官方都把这条写成了规则,并建议同时说明位置和字体风格。
- 先短后长。官方建议从简短描述起步,只补充「能改变画面」的信息;堆字数不等于效果好。
- 编辑图片时写祈使句,并显式说明哪些要保持不变,比如「换成红色外套,保持面部特征和发型不变」。
权重语法:分情况,别一刀切
(word:1.2) 这类权重语法的现状比传言复杂。以 ComfyUI 源码为准:
| 文本编码器 | 对应模型 | 权重语法 |
|---|---|---|
| CLIP / T5-XXL | SD 1.5、SDXL、SD 3.5、FLUX.1 | 仍然有效 |
| Qwen2.5-VL 等 LLM 类 | Qwen-Image、Z-Image、FLUX.2 | 已被显式禁用 |
在被禁用的模型上,括号和 :1.2 会被当成普通文字塞进提示词里,不产生任何加权效果。所以老教程里的权重技巧,在 FLUX.1 上照用没问题,在 Qwen-Image 上就是无效操作。
负向提示词也分家了
FLUX 官方明确「多数 FLUX 模型不支持负向提示词」,建议改成正向描述——想要没有人的街道,写 empty, deserted street,而不是 no people。Qwen-Image 则仍然支持负向提示词。用之前先确认你的模型属于哪一类。
五、关键参数
新模型的参数逻辑和老模型不同,尤其是 guidance:
| 模型 | 步数 | guidance / CFG |
|---|---|---|
| FLUX.1 dev | 20~28 | guidance 3.5(CFG 固定 1.0) |
| FLUX.1 schnell | 4 | CFG 1.0 |
| FLUX.2 dev | 20~50 | guidance 4 |
| FLUX.2 klein 蒸馏版 | 4 | CFG 1.0 |
| Qwen-Image | 20~50 | true_cfg 4.0 |
| SD 3.5 Large | 20~40 | CFG 3.5~4.5 |
FLUX 的 dev 系列是「guidance 蒸馏」模型——guidance 是作为条件输入喂给模型的,不是传统的双次前向 CFG,所以要把 CFG 设成 1.0,另外用 guidance 参数控制。蒸馏的 klein 版本连 guidance 都被锁死了。
提示
同一个模型,模型方推荐的步数往往高于 ComfyUI 官方模板(比如 FLUX.2-dev 官方说 50 步、模板给 20 步)。两边都不算错,先按模板跑通,再按需要加步数换质量。
也别从零试错。先完整复现一组别人验证过的「模型 + 提示词 + 参数」,确认能跑通、出图正常,再在此基础上逐项微调——这比凭空乱调高效得多。