背景

此前用 Flash 模型讨论”用 ComfyUI 生成 paper 架构图”时,AI 声称存在一个”专为绘图文字清晰度优化的 QLoRA”可以解决 SDXL 中文渲染问题。这个 LoRA 不存在——它是 AI 在概念空间里生成的合理但虚假的推理链。这个案例后来被记录为 置信度的幻觉:人机协作中的认知陷阱 的案例 1。

本文基于实际调查,回答两个问题:

  1. 本地 ComfyUI (SDXL) 到底能做什么、不能做什么?
  2. 生成 paper 架构图,该用什么工具?

一、ComfyUI / SDXL 的能力边界

本地环境

  • 显卡:RTX 4090 24GB
  • 安装位置:Windows 侧 D:\comfyui\ComfyUI_windows_portable\
  • 模型:SDXL base 1.0 (~6.5GB)
  • LoRA:无
  • ComfyUI v0.22.0,端口 8188

能做什么

能力说明
文生图 (txt2img)从 prompt 生成任意风格图像——风景、人物、抽象、概念艺术
图生图 (img2img)在现有图像基础上变换风格/内容
修复 (inpainting)填充或替换图像中的指定区域
超分 (upscaling)ESRGAN 等模型提升分辨率
批量生成同一 prompt 多 seed 变体
技术示意图(无文字)机械结构、生物解剖、建筑概念——不需要文字标注的视觉内容
风格迁移将照片转为水彩/油画/线稿等风格
AnimateDiff 视频如安装相关节点,可生成短动画

不能做什么

限制原因
生成可读的中文文字SDXL 的文字渲染是架构级限制,不是微调能解决的。生成的中文必然是乱码或形似字的无意义笔画
生成可读的英文文字同样差,只是偶尔能碰出 2-3 个字母的短词
流程图/架构图(含文字标注)文字问题直接否决了这种用途
精确的数据图表无法保证数字/刻度/标签的正确性
UI 界面原型按钮文字、标签、菜单项全部不可读

核心认知

SDXL 是像素生成器,不是信息排版引擎。它能生成”看起来像流程图”的图像,但上面的文字是装饰性的、不可读的。如果你需要观众理解图上写了什么,SDXL 做不到。

不存在的 LoRA:Civitai、Hugging Face 上不存在”让 SDXL 写出清晰中文”的 LoRA。文本渲染是扩散模型的底层能力问题,不是加一层微调能解决的。这是”合理但虚假”的 AI 推理链的典型案例。


二、本地 ComfyUI 的实用场景

基于以上边界,本地 SDXL 适合这些方向:

1. 创意图像生成(最核心的用途)

  • 概念艺术、氛围图、风格化插画
  • 论文的视觉封面/头图(不含文字,事后叠加标题)
  • 灵感板、mood board

2. 图像变换与修复

  • 老照片修复/上色
  • 图片局部替换
  • 分辨率提升

3. 生成”底图” + 后处理叠加文字

这是 paper-deck skill 推荐的生产级方案:

  • SDXL 生成视觉背景、模块布局、箭头关系
  • 用 python-pptx / PIL 在图片上精确叠加文字图层
  • 中文/英文都完全可读
  • 缺点是两步操作,不能一键完成

4. SDXL 做不到但 FLUX/SD3 可以部分改善

  • FLUX 和 SD3 的文字渲染能力明显强于 SDXL
  • 英文短词成功率较高,中文仍不可靠
  • 但本地 RTX 4090 24GB 可以跑 FLUX Dev fp8(~12GB),如果愿意下载模型

三、架构图生成工具全景对比

以下是 不需要依赖 AI 图像生成 的架构图工具(不存在文字质量问题):

工具实现方式适合场景在哪用
architecture-diagram纯 SVG/HTML 代码生成系统架构、云基础设施、微服务拓扑hermes skill,生成 .html 直接浏览器打开
excalidrawJSON 手绘风格元素快速草图、流程图、概念关系图hermes skill,.excalidraw 文件拖入 excalidraw.com
Mermaid文本→图表编译流程图、时序图、类图、状态图Obsidian 原生支持,代码块即可渲染
huashu-design纯 HTML/CSS 设计高保真原型、交互 Demo、幻灯片hermes skill,40 种 CSS 风格库,Playwright 渲染

共同优势

  • 不需要 GPU
  • 不需要 AI 图像模型
  • 文字永远清晰可读(因为是真正的文字渲染,不是像素生成)
  • 输出是代码,可以精确编辑和版本控制

还有这些依赖图像的方案(需要处理文字问题):

工具方式文字方案
paper-comicSDXL 生成 sketchnote 风格底图必须走”底图+叠加文字”后处理
paper-deck逐页生成 slide image → 合成 PPTX推荐底图+python-pptx 叠加;或用 FLUX/SD3 改善英文
baoyu-infographic信息图生成(21×21 风格矩阵)依赖生图模型,中文同样受限

四、推荐方案:按需选择

场景 A:论文系统架构图、云部署图

architecture-diagram skill

  • 生成一个自包含 HTML 文件
  • 暗色主题、专业排版、CSS 标注卡片
  • 零依赖,浏览器打开即用
  • 示例路径:_outputs/diagrams/paper-arch.html

场景 B:论文方法流程图、算法流程图

Mermaid(首选)或 excalidraw(需要手绘风格时)

  • Mermaid 直接写在 Obsidian 代码块里,实时渲染
  • excalidraw 生成 .excalidraw 文件,拖入 excalidraw.com 编辑导出

场景 C:论文视觉封面/头图 + 标题

→ SDXL 生成底图 + PIL 叠加标题文字

  • 这是最可靠的生产级方案
  • 标题可以精确控制字体、大小、位置

场景 D:完整论文讲解幻灯片

paper-deck skill

  • 优先用纯排版方案(python-pptx 直接绘制)
  • 需要视觉背景时走”底图+叠加文字”路线
  • 不依赖 AI 生成文字

五、总结

之前想用 ComfyUI + SDXL 生成带中文的流程图,问题的根源不是 SDXL 不够好——而是 SDXL 根本就不是做这件事的工具。AI 编造了一个不存在的 QLoRA 来弥合”用户想做的事”和”SDXL 能做的事”之间的差距。

本地 ComfyUI 的正确用法:生成”不需要文字可读”的视觉内容——概念图、氛围图、风格化图像、底图背景。

架构图的正确工具:architecture-diagram(系统架构)、Mermaid(流程图)、excalidraw(手绘草图)、paper-deck(幻灯片)。这些都是代码生成方案,文字清晰度天然完美,不需要任何 AI 图像模型。

中文支持问题的根本出路:不是找更好的生图模型,而是把”生成图像”和”叠加文字”拆成两步——生图模型负责视觉,排版引擎负责文字。