背景
此前用 Flash 模型讨论”用 ComfyUI 生成 paper 架构图”时,AI 声称存在一个”专为绘图文字清晰度优化的 QLoRA”可以解决 SDXL 中文渲染问题。这个 LoRA 不存在——它是 AI 在概念空间里生成的合理但虚假的推理链。这个案例后来被记录为 置信度的幻觉:人机协作中的认知陷阱 的案例 1。
本文基于实际调查,回答两个问题:
- 本地 ComfyUI (SDXL) 到底能做什么、不能做什么?
- 生成 paper 架构图,该用什么工具?
一、ComfyUI / SDXL 的能力边界
本地环境
- 显卡:RTX 4090 24GB
- 安装位置:Windows 侧 D:\comfyui\ComfyUI_windows_portable\
- 模型:SDXL base 1.0 (~6.5GB)
- LoRA:无
- ComfyUI v0.22.0,端口 8188
能做什么
| 能力 | 说明 |
|---|---|
| 文生图 (txt2img) | 从 prompt 生成任意风格图像——风景、人物、抽象、概念艺术 |
| 图生图 (img2img) | 在现有图像基础上变换风格/内容 |
| 修复 (inpainting) | 填充或替换图像中的指定区域 |
| 超分 (upscaling) | ESRGAN 等模型提升分辨率 |
| 批量生成 | 同一 prompt 多 seed 变体 |
| 技术示意图(无文字) | 机械结构、生物解剖、建筑概念——不需要文字标注的视觉内容 |
| 风格迁移 | 将照片转为水彩/油画/线稿等风格 |
| AnimateDiff 视频 | 如安装相关节点,可生成短动画 |
不能做什么
| 限制 | 原因 |
|---|---|
| 生成可读的中文文字 | SDXL 的文字渲染是架构级限制,不是微调能解决的。生成的中文必然是乱码或形似字的无意义笔画 |
| 生成可读的英文文字 | 同样差,只是偶尔能碰出 2-3 个字母的短词 |
| 流程图/架构图(含文字标注) | 文字问题直接否决了这种用途 |
| 精确的数据图表 | 无法保证数字/刻度/标签的正确性 |
| UI 界面原型 | 按钮文字、标签、菜单项全部不可读 |
核心认知
SDXL 是像素生成器,不是信息排版引擎。它能生成”看起来像流程图”的图像,但上面的文字是装饰性的、不可读的。如果你需要观众理解图上写了什么,SDXL 做不到。
不存在的 LoRA:Civitai、Hugging Face 上不存在”让 SDXL 写出清晰中文”的 LoRA。文本渲染是扩散模型的底层能力问题,不是加一层微调能解决的。这是”合理但虚假”的 AI 推理链的典型案例。
二、本地 ComfyUI 的实用场景
基于以上边界,本地 SDXL 适合这些方向:
1. 创意图像生成(最核心的用途)
- 概念艺术、氛围图、风格化插画
- 论文的视觉封面/头图(不含文字,事后叠加标题)
- 灵感板、mood board
2. 图像变换与修复
- 老照片修复/上色
- 图片局部替换
- 分辨率提升
3. 生成”底图” + 后处理叠加文字
这是 paper-deck skill 推荐的生产级方案:
- SDXL 生成视觉背景、模块布局、箭头关系
- 用 python-pptx / PIL 在图片上精确叠加文字图层
- 中文/英文都完全可读
- 缺点是两步操作,不能一键完成
4. SDXL 做不到但 FLUX/SD3 可以部分改善
- FLUX 和 SD3 的文字渲染能力明显强于 SDXL
- 英文短词成功率较高,中文仍不可靠
- 但本地 RTX 4090 24GB 可以跑 FLUX Dev fp8(~12GB),如果愿意下载模型
三、架构图生成工具全景对比
以下是 不需要依赖 AI 图像生成 的架构图工具(不存在文字质量问题):
| 工具 | 实现方式 | 适合场景 | 在哪用 |
|---|---|---|---|
| architecture-diagram | 纯 SVG/HTML 代码生成 | 系统架构、云基础设施、微服务拓扑 | hermes skill,生成 .html 直接浏览器打开 |
| excalidraw | JSON 手绘风格元素 | 快速草图、流程图、概念关系图 | hermes skill,.excalidraw 文件拖入 excalidraw.com |
| Mermaid | 文本→图表编译 | 流程图、时序图、类图、状态图 | Obsidian 原生支持,代码块即可渲染 |
| huashu-design | 纯 HTML/CSS 设计 | 高保真原型、交互 Demo、幻灯片 | hermes skill,40 种 CSS 风格库,Playwright 渲染 |
共同优势:
- 不需要 GPU
- 不需要 AI 图像模型
- 文字永远清晰可读(因为是真正的文字渲染,不是像素生成)
- 输出是代码,可以精确编辑和版本控制
还有这些依赖图像的方案(需要处理文字问题):
| 工具 | 方式 | 文字方案 |
|---|---|---|
| paper-comic | SDXL 生成 sketchnote 风格底图 | 必须走”底图+叠加文字”后处理 |
| paper-deck | 逐页生成 slide image → 合成 PPTX | 推荐底图+python-pptx 叠加;或用 FLUX/SD3 改善英文 |
| baoyu-infographic | 信息图生成(21×21 风格矩阵) | 依赖生图模型,中文同样受限 |
四、推荐方案:按需选择
场景 A:论文系统架构图、云部署图
→ architecture-diagram skill
- 生成一个自包含 HTML 文件
- 暗色主题、专业排版、CSS 标注卡片
- 零依赖,浏览器打开即用
- 示例路径:
_outputs/diagrams/paper-arch.html
场景 B:论文方法流程图、算法流程图
→ Mermaid(首选)或 excalidraw(需要手绘风格时)
- Mermaid 直接写在 Obsidian 代码块里,实时渲染
- excalidraw 生成 .excalidraw 文件,拖入 excalidraw.com 编辑导出
场景 C:论文视觉封面/头图 + 标题
→ SDXL 生成底图 + PIL 叠加标题文字
- 这是最可靠的生产级方案
- 标题可以精确控制字体、大小、位置
场景 D:完整论文讲解幻灯片
→ paper-deck skill
- 优先用纯排版方案(python-pptx 直接绘制)
- 需要视觉背景时走”底图+叠加文字”路线
- 不依赖 AI 生成文字
五、总结
之前想用 ComfyUI + SDXL 生成带中文的流程图,问题的根源不是 SDXL 不够好——而是 SDXL 根本就不是做这件事的工具。AI 编造了一个不存在的 QLoRA 来弥合”用户想做的事”和”SDXL 能做的事”之间的差距。
本地 ComfyUI 的正确用法:生成”不需要文字可读”的视觉内容——概念图、氛围图、风格化图像、底图背景。
架构图的正确工具:architecture-diagram(系统架构)、Mermaid(流程图)、excalidraw(手绘草图)、paper-deck(幻灯片)。这些都是代码生成方案,文字清晰度天然完美,不需要任何 AI 图像模型。
中文支持问题的根本出路:不是找更好的生图模型,而是把”生成图像”和”叠加文字”拆成两步——生图模型负责视觉,排版引擎负责文字。