Dramaturge: 即插即用的分治式长叙事脚本迭代精炼

问题 (Problem)

长叙事脚本的单次生成(single-pass)质量不足是核心痛点。直接让 LLM 一次性生成长篇叙事存在三大困难:(1) 难以全面理解长脚本来识别全局结构性缺陷与局部细节问题,修订往往流于表面;(2) 跨粒度和跨位置的修订难以协调,局部编辑容易与整体叙事产生不一致;(3) 缺少人类编剧所采用的”多轮审阅—修订”迭代流程,导致脚本缺乏连贯性和戏剧张力。现有方法(Dramatron、DOC、Agents’ Room 等)均为单次生成范式,忽视了创作实践中的反复打磨环节。

解决方案 (Solution)

Dramaturge 提出一种”任务+特征”双维度的分治策略,通过层级化多 LLM Agent 协同实现由粗到精的迭代脚本修订。核心流程为三阶段:Global Review(全局审阅)Scene-level Review(场景级审阅)Hierarchical Coordinated Revision(层级协调修订)

全局审阅阶段:先由 Summarizer 生成情节摘要,然后四个专业评估 Agent 并行工作——Engagement Evaluator(故事吸引力)、Character Evaluator(角色发展)、Theme Evaluator(主题深度)、Narrative Evaluator(叙事结构)。Global Review Integrator 对各评估建议按范围(结构性指令 > 跨场景调整 > 局部优化)和情节关联度排优先级,消解冲突后输出全局改进策略。

场景级审阅阶段:在全局策略指导下遍历每个场景,由四个检查 Agent(Dialogue Inspector、Scene Description Inspector、Plot Inspector、Character Inspector)进行细粒度缺陷定位。Scene-level Review Integrator 采用三级优先级策略整合建议(必须遵循全局指令 > 跨场景影响 > 检查类型),然后 Suggestion Router 将具体修改建议路由至后续的 Dialogue Editor 或 Scene Editor。

层级协调修订阶段:Storyline Editor 在全局策略指导下重构/增强情节结构;Scene Editor 和 Dialogue Editor 分别执行场景描述和对话的精细化编辑;Script Description Editor 更新标题和角色描述保持一致性;Script Polisher 最后做全脚本一致性校验。自顶向下的信息流确保高层策略系统性地指导局部修改。

整个流程在两个阶段中迭代:Phase 1(structural refinement)处理根本性叙事问题;Phase 2(detail refinement)锁定故事线后精修细节,通过质量阈值(1.0分)控制收敛,最多重试 𝑁max=3 次后停止。

评估 (Evaluation)

数据集:从 5 个来源(WritingPrompts、Dramatron、DOC、MoPS、Agents’ Room)收集 100 个叙事脚本。

评估指标:四个维度——Character Development(角色发展)、Narrative Structure(叙事结构)、Dialogue Quality(对话质量)、Scene Presentation(场景呈现),每个维度 25 分制。双层评估:Script-Level Overall Evaluation(全脚本整体评分)和 Scene-Level Comparative Evaluation(场景级配对比较)。

自动评估结果(使用 Gemini-2.5-pro 作为严格评估器):

  • Script-Level 总分:84.60,比原始脚本提升 53.2%,比最强基线 Gemini-2.5-pro 高出 8.2%
  • Scene-Level 总分:90.00,比原始脚本提升 65.1%,比最强基线高出 18.4%
  • 尽管使用了相对较弱的骨干模型 GPT-4.1-mini,Dramaturge 仍大幅超越所有基线(GPT-4o、Qwen-max、DeepSeek-r1、GPT-4.1、Gemini-2.5-pro)

人工评估:42 名专业编剧盲评。Dramaturge vs 原脚本获胜率 88-92%;vs GPT-4o 获胜率 76-80%;vs Gemini-2.5-pro 获胜率 60-66%,平局 26-31%,失败仅 8-11%。

消融实验:完整三阶段组合(HCR+GR+SLR)得分 84.60,仅 HCR 为 68.30,HCR+SLR 为 72.20,HCR+GR 为 74.70。验证了层级架构和多 Agent 协作的有效性。单个迭代的 LLM 调用成本仅比单次生成方法高约 51%,Agent 在各阶段并行执行,通常约 6 次迭代收敛。

优势 (Strengths)

  • 即插即用:可作为任何现有脚本生成方法的后处理增强模块,无需修改原流程
  • 系统性提升:Script-Level 提升 53.2%,Scene-Level 提升 65.1%,scene 级改进幅度更大,说明细节修正能力强
  • 一致性保障:自顶向下信息流使全局策略指导局部修改,避免引入新的不一致性
  • 弱模型也能强性能:用 GPT-4.1-mini(轻量模型)超越 Gemini-2.5-pro(旗舰模型),证明架构设计的价值大于模型容量
  • 人工验证充分:42位专业编剧盲评,多维度均获显著偏好
  • 收敛可控:粗到精两阶段迭代配合质量阈值,确保稳定收敛

劣势 (Weaknesses)

  • 计算开销:每次完整迭代涉及多个 Agent 调用,虽仅比单次生成高 51% 但仍显著增加成本(约需 6 次迭代收敛)
  • 强依赖 LLM 评估:评估框架依赖 Gemini-2.5-pro 作为评估器,虽然与人工评估一致,但自动化评估作为唯一自动指标的稳健性尚需更多验证
  • 数据集规模有限:100 个脚本虽然覆盖 5 个来源,但相比其他 NLP 任务仍然偏小
  • 仅做后处理:只能修订已有脚本,不能从零生成,本质上是一个 refinement 模块而非完整的生成系统
  • 缺乏可控性:修订过程完全自动,用户无法在迭代过程中干预或指定修订方向
  • 场景划分假定:依赖于输入脚本已有 scene 划分,对未结构化的自由叙事文本可能需要预处理

流水线 (Pipeline)

输入脚本 𝑆₀
    │
    ▼
┌─────────────┐
│  Summarizer │ → 生成情节摘要 𝑃
└─────────────┘
    │
    ▼
┌──────────────────────────────────────────────────┐
│           Global Review (全局审阅)                │
│  ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌───────┐│
│  │Engagement│ │Character │ │  Theme   │ │Narrative││
│  │Evaluator │ │Evaluator │ │Evaluator │ │Evaluator││
│  └────┬─────┘ └────┬─────┘ └────┬─────┘ └───┬─────┘│
│       └─────────────┴────────────┴────────────┘     │
│                         │                           │
│              ┌──────────▼───────────┐              │
│              │ Global Review        │              │
│              │ Integrator (冲突消解) │              │
│              └──────────┬───────────┘              │
└─────────────────────────┼──────────────────────────┘
                          │ 全局策略 𝐺
                          ▼
┌──────────────────────────────────────────────────┐
│         Scene-level Review (场景级审阅)           │
│  对每个场景 𝑠ⱼ:                                  │
│  ┌──────────┐ ┌──────────┐ ┌──────────┐ ┌───────┐│
│  │ Dialogue │ │  Scene   │ │  Plot    │ │ Char.  ││
│  │Inspector │ │  Desc    │ │Inspector │ │Inspector││
│  └────┬─────┘ └────┬─────┘ └────┬─────┘ └───┬─────┘│
│       └─────────────┴────────────┴────────────┘     │
│                         │                           │
│        ┌────────────────▼──────────────┐           │
│        │ Scene-level Review Integrator │           │
│        │ (遵循全局指令优先)             │           │
│        └────────────────┬──────────────┘           │
│                         │                           │
│        ┌────────────────▼──────────────┐           │
│        │   Suggestion Router           │           │
│        │ (路由至Dialogue/Scene Editor)  │           │
│        └────────────────┬──────────────┘           │
└─────────────────────────┼──────────────────────────┘
                          │
                          ▼
┌──────────────────────────────────────────────────┐
│   Hierarchical Coordinated Revision (层级协调修订) │
│  ┌──────────────────────────────────────────────┐ │
│  │  Storyline Editor (情节重构, Phase 1 only)   │ │
│  └──────────────────────────────────────────────┘ │
│  ┌───────────────┐  ┌──────────────────────────┐ │
│  │ Scene Editor  │  │   Dialogue Editor        │ │
│  │ (场景描述编辑) │  │   (对话编辑)              │ │
│  └───────────────┘  └──────────────────────────┘ │
│  ┌──────────────────────────────────────────────┐ │
│  │  Script Description Editor (元数据更新)      │ │
│  └──────────────────────────────────────────────┘ │
│  ┌──────────────────────────────────────────────┐ │
│  │  Script Polisher (一致性校验)                │ │
│  └──────────────────────────────────────────────┘ │
└──────────────────────────────────────────────────┘
                          │
                          ▼
                    输出修订脚本 𝑆ᵢ₊₁
                          │
                          ▼
               ┌───────────────────┐
               │ EvaluateImprove() │
               │ 质量提升 Δ < θ ?  │
               └───────┬───────────┘
                  Yes  │   No
                  ◄────┘   ───► 收敛,返回最优版
   (Phase 切换: structural → detail)

参考链接

此文件夹下有0条笔记。