叙事理论综述:结构化提取
覆盖范围 (Scope)
本综述覆盖NLP领域中运用LLM进行自动故事生成和理解的研究,聚焦于叙事理论如何影响NLP管线。核心覆盖:(1) 叙事理论与文本数据集的使用模式;(2) LLM在叙事任务中的方法论(提示工程、微调、多智能体系统);(3) 叙事学理论分类体系(古典/认知/语境/跨媒介叙事学);(4) 数据集来源(小说、短故事、新闻、Reddit、维基百科、民间故事等);(5) 叙事层级(fabula/discourse/narration三层模型)。综述排除了非CS领域发表的研究、非LLM方法(如CNN、扩散模型)、以及视觉/音频叙事模态。时间范围覆盖至2025年,涵盖GPT-4、Llama-3等最新模型。
分类体系 (Taxonomy)
综述提出两个核心分类维度:
维度一:叙事层级分类(源自Genette 1980)
- Fabula(故事层):按时间顺序排列的事件序列,抽象的”发生了什么”。任务包括事件分割、角色分类、交互标注、事件构建。
- Discourse(话语层):故事的呈现方式,包括结构、风格、媒介选择。任务包括文本特征提取与标注、叙事嵌入、生成控制。
- Narration(叙述层):叙述行为本身,涉及叙述者、受叙者、叙述时间、可靠性。任务包括修辞意图理解、道德提取、叙述者可靠性分类。
维度二:叙事学理论流派分类
- 古典叙事学(最常用):形式主义/结构主义理论,如Propp的故事形态学、Vonnegut的故事形状、Campbell的英雄之旅、Genette的话语理论、Freytag金字塔。
- 认知叙事学:读者认知加工过程,如Keen的叙事共情理论、Holland的读者反应批评、Gavins的文本世界理论。
- 语境叙事学:文化/历史/意识形态语境分析,考察叙事如何反映性别、政治、集体身份。
- 跨媒介叙事学(本文未深入):跨体裁、跨媒介的叙事结构适应。
另有”叙事性(narrativity)“作为标量属性(非二元)贯穿各流派,Piper & Bagga将其操作化为15个可测量特征。
核心发现 (Key Findings)
-
理论使用极度不均衡:古典叙事学(形式主义/结构主义)被引用最广泛,语境叙事学和认知叙事学使用较少,跨媒介叙事学几乎未被LLM研究采用。形成”理论-领域错配”:广泛使用文学理论分析非文学数据集(如新闻、社交媒体)。
-
故事生成缺微调、唯提示:一个重要模式——故事生成任务几乎全部使用提示工程(零样本/少样本),而微调仅限于故事理解任务。目前没有成熟的监督学习或强化学习方法用于故事生成。这可能是LLM创造性生成微调困难或硬件成本限制的结果。
-
LLM输出与人工标注仅低至中度相关:无论是标注任务还是评估任务,LLM输出与人类专家的Spearman/Pearson/Kendall相关系数普遍不高(多数研究如此报告),LLM评估者偏好更大模型的输出。
-
话语层最受关注:在fabula-discourse-narration三层中,discourse(话语层)研究最多,其次是narration(叙述层),fabula(故事层)最少。理解任务多于生成任务。
-
编码器→解码器的明显转移:WNU研讨会数据显示,2024年4/9篇使用解码器模型,2025年10/10篇全部使用解码器。叙事研究领域正从BERT等编码器转向GPT/Llama等解码器。
-
叙事学知识可”隐式”应用:研究者即使未明确引用叙事理论,也能运用日常化了的叙事概念(如”起承转合”),但更深入的理论引用能带来更有意义的跨学科对话。
涵盖的方法与理论 (Methods & Theories)
叙事理论来源
- 古典叙事学:Propp故事形态学、Vonnegut故事形状、Campbell英雄之旅、Genette话语理论(时态/语式/语态)、Freytag金字塔、Van Dijk宏观结构、Todorov叙事均衡/因果理论、Chatman故事/话语二分法
- 认知叙事学:Keen叙事共情理论、Van Krieken语言线索框架、Holland读者反应批评、Gavins文本世界理论
- 语境/社会叙事理论:Labov社会语言学叙事理论、Berman叙事发展理论、Lincoln神话理论、Moretti远读/网络理论
- 叙事性理论:Herman基础叙事元素、Bal/Prince叙事特征分类、Piper等人15特征操作化框架
LLM技术方法
- 提示工程(主流):零样本/少样本提示、角色提示、链式思维提示、迭代提示、混合角色提示(MoP)
- 微调(仅理解任务):LoRA参数高效微调、监督微调小型模型(7B-8B)、知识蒸馏(大模型输出训练小模型)、领域自适应预训练(DAPT)
- 多智能体系统:Yu等人角色模拟+重写两步法、Ran等人多智能体交互叙事
- 模型选择:GPT-4/4o/3.5、Llama-3(8B)、Claude、Gemini、Mixtral、Phi-3等
评估现状 (Evaluation Landscape)
当前常用评估方法:
- 自动化指标:BLEU(但公认不适用于故事评估)、BERTScore、BERT相似度、F1、困惑度
- 标注者一致性:Cohen’s Kappa、Krippendorff’s Alpha、Spearman/Pearson/Kendall相关系数
- 人工评估:Likert量表评分(相关性、连贯性、共情、惊喜、参与度、复杂性)、Torrance创意写作测试(TTCW)、创意写作评分标准的质性分析
- LLM作为评估者:GPT-4/ChatGPT直接评分或成对比较
核心缺失:
- 缺乏统一的”叙事质量”基准和评价标准
- 不同研究使用互不兼容的指标,导致跨研究比较几乎不可能
- LLM评估与人类专家的相关性低至中度,尚不能替代人工
- 缺乏理论驱动的单维度度量指标(如因果性、叙事弧、角色发展等独立度量)
- 缺乏长篇叙事的标注数据集
- 多语言/非英语叙事语料严重不足
未来方向 (Future Directions)
-
拓宽理论视野:不要只盯着古典叙事学,应探索更广泛的叙事研究领域——历史叙事化(emplotment)、国际关系中的战略叙事、叙事身份理论、法律叙事等。LLM的规模化优势特别适合这些领域。
-
验证特定叙事理论:选择一项具体的叙事理论主张(如Keen”小说比其他体裁更能激发共情”),设计系统性实验来验证或挑战该理论——使NLP成为叙事理论的”实验室”。
-
开发单维度指标:放弃追求无所不包的”叙事质量”统一基准,转而开发衡量单个叙事属性(如因果连贯性、人物一致性、风格多样性、叙事弧结构)的理论驱动指标,逐步积累可组合的评估工具。
-
研究叙事文本预训练对LLM的影响:大量叙事文本被用于LLM预训练——更多或更少的叙事训练数据对模型行为有何影响?这是尚未被探索的重要问题。
-
探索故事生成的后训练方法:目前故事生成几乎只有提示工程,缺乏微调/RLHF/DPO等方法研究。是否存在”叙述调谐(narration-tuned)“LLM的可能性?——既然语言可能源于叙事而非指令遵循。
-
将LLM本身视为叙事产物:这是最具启发性的展望——LLM比人类历史上任何文字制品包含更多叙事文本。LLM是什么类型的叙事产物?这个问题可能导向新的架构设计。
实践要点 (Practical Takeaways)
对于构建故事生成系统的人,以下几点至关重要:
-
分离叙事层级是金钥匙:采用fabula-discourse双阶段架构——先规划故事事件和角色(fabula层),再进行文本呈现(discourse层)。这是当前最成功的生成策略,被R²、MangaFlow、Yu等多智能体系统等验证。
-
叙事理论比表面看起来更有用:不要满足于”起承转合”的民间直觉。Genette的话语理论、Propp的功能序列、Vonnegut的故事形状曲线等古典叙事学工具可以提供精确可控的文本规划框架。例如Genette的时态/语式/语态三维度已成功映射为提示模板中的可测量特征。
-
提示工程是最实用但非唯一的路径:当前故事生成主要靠提示工程(零样本为主),复杂提示策略(链式思维、MoP)能带来增量改进但提升有限。简单提示在效率和性能上常不输复杂提示——不要过度设计prompt。
-
人类评委仍是金标准:不要轻信LLM评估——当前LLM评估者与人类专家仅有低至中度相关。在关键决策中保留人工评估环节,LLM评估可作初步筛选。
-
故事一致性靠记忆而非模型本身:长文本一致性是核心挑战。有效策略包括:显式维护角色状态/场景引用(如MangaFlow的故事单元记忆)、因果图结构(如R²)、角色记忆提示(如Yu的系统)。不要期望LLM自行”记住”长故事中的所有约束。
-
叙事性是可操作的标量属性:Piper & Bagga的15特征操作化框架(agency、event sequencing、world building、causal relations、rhetorical purpose等子维度)可以直接用于评估生成文本的叙事质量,也可作为生成控制信号。
-
关注文化偏见与模式坍缩:LLM生成的叙事倾向于套用Pyttmalion等经典原型、偏好西方叙事模式、对齐训练会减少作者风格的多样性。在创意写作系统中需加入多样性控制机制。