INTRA 论文方法图解 — 5 张 sketchnote
Page 1: 封面总览 — INTRA vs 传统 RAG
内容描述
主视觉: 水平二分对比布局。
左侧(传统 RAG):
- 上方三个图标:Query → [External Retriever (放大镜图标)] → Text Chunks
- 然后一个箭头指向 [Generator LLM),标注”重编码”
- 下方大字标注: ❌ 分离系统 · 分属不同空间
右侧(INTRA):
- Query → [Frozen Encoder (T5Gemma2)] → 编码后的 Chunk 状态
- 然后两个步骤:① Decoder Retrieval Pass(检索前向传播)→ ② Decoder Generation Pass(生成前向传播)
- 下方大字标注: ✅ 统一空间 · 注意力即检索
中间一个大箭头或 VS 标志隔开。
底部小字: “Retrieval from Within · NVIDIA 2026”
Sketchnote 风格要求
背景:亮米白 fff8ea 主色:黑色手绘线条 强调色:左侧用冷灰/浅红(表示外部),右侧用深蓝 2c5f8a(表示内在) 关键词加亮色框/下划线 左下角手写页码 “1/5”
生图 Prompt
【类型】对比图解
【风格】sketchnote
【语言】中文
【主题】INTRA vs 传统 RAG — 注意力即检索
【视觉结构】左右二分对比布局,中间VS分隔线
【左侧内容】Query→外部检索器→文本→重编码→生成器
【右侧内容】Query→T5Gemma2编码器→编码状态→Decoder检索前向传播→生成前向传播
【要标注的文字】左侧:分离系统 / 分属不同空间 | 右侧:统一空间 / 注意力即检索
【颜色限制】亮米白底 + 黑色手绘线条 + 左侧冷灰/淡红 + 右侧深蓝强调
【禁止】不要照片写实/3D渲染/真实纹理/人物/对话气泡
Page 2: 核心机制 A — Attention as Retrieval
内容描述
展示 decoder cross-attention 如何变成检索信号。
主区域:一个 T5Gemma2 Decoder Layer 的截面图
- 左侧输入 “Query Tokens + Retrieval Tokens [ρ₁, ρ₂, …, ρᵣ]”
- 中间显示 Cross-Attention 模块,内部标注 “Score = MaxSim(qℓ, kᵢ)”
- 右侧显示预编码 chunk 池 “K = {k₁, k₂, …, kₘ}”
- 从 Cross-Attention 发出一束扫描线到右侧 chunk 池,顶部 4 个 chunk 被高亮选中
底部公式区域(手写风格):
- sᵢ = Σₗ αₗ · MaxSim(qₗ, kᵢ)
- 旁边小字:“逐层加权求和”
关键标注:
- “retrieval tokens ρ: 仅 4K 参数,可学习”
- “decoder 权重冻结,0.1% 参数量级”
- ColBERT-style late interaction
生图 Prompt
【类型】机制分解图
【风格】sketchnote
【语言】中文
【主题】Attention as Retrieval — Decoder Cross-Attention 变身检索信号
【视觉结构】中心画一个Decoder Layer截面,左侧Query输入(含Retrieval Tokens),右侧预编码Chunk池,Cross-Attention发出光线扫描,Top-4高亮
【包括公式】sᵢ = Σₗ αₗ · MaxSim(qₗ, kᵢ) 手写体在底部
【要标注的文字】retrieval tokens ρ: 仅4K参数可学习 | decoder冻结 | ColBERT-style MaxSim | 逐层加权求和 | 从token级attention到chunk级检索
【颜色】亮米白底,黑色手绘线条,深蓝强调公式和关键数字,珊瑚红高亮top-4 chunk
【禁止】不要照片写实/3D/UI截图/代码块
Page 3: 核心机制 B — 训练与推理流程
内容描述
展示 INTRA 的两次前向传播。
分上下两个部分:
上半部分 - 训练阶段:
- 框内写:“仅训练 retrieval tokens ρ + 层权重 α”
- 旁边小字:4K 参数 / 12 个权重
- 损失函数公式手写框: L_retrieval = -1/|O(x)| · Σ log(softmax(s)ⱼ)
- 标注 “soft cross-entropy on oracle evidence”
下半部分 - 推理阶段(两次前向传播):
- 第一次前向传播: Query → Encoder → Decoder(检索模式) → 对所有M个chunk评分 → 选出Top-n
- 大箭头连接
- 第二次前向传播: Top-n chunk状态 + Query → Decoder(生成模式) → 答案
- 标注 “预编码状态复用,无需重编码”
右侧垂直标注条:
- “推理 = 2× Decoder 前向传播”
- “全语料评分 O(M·Lq·Lc) → 选5个生成”
生图 Prompt
【类型】流程分解图
【风格】sketchnote
【语言】中文
【主题】INTRA 训练与推理 — 两次前向传播的完整流程
【视觉结构】上下分区:上半部训练(retrieval tokens + loss),下半部推理(第一次检索前向传播评分→选top-n→第二次生成前向传播)。右侧垂直标注条
【包括公式】L_retrieval = -1/|O(x)| · Σ log(softmax(s)ⱼ) 手写体
【要标注的文字】训练仅4K参数 | 推理=2次Decoder前向传播 | 预编码状态复用无需重编码 | 全语料评分→选5个
【颜色】亮米白底,黑色手绘线条,训练区用橄榄绿,推理两步用深蓝+珊瑚红区分,公式框浅黄底
【禁止】不要照片写实/3D/UI截图/代码块
Page 4: 核心机制 C — 三级检索策略
内容描述
展示从粗到精的三级检索流程。
从左到右三级流程:
第一级:Encoder-side MaxSim 粗筛
- Encoder 编码 Query 和所有 chunks
- MaxSim(kₓ, kᵢ) → 选 Top-16 (S₀)
- 标注 “16个候选,与 ColBERT 类似”
第二级: Decoder Reranking
- S₀ 中的 16 个经过 decoder,打分重排序
- 标注 ” reranking 提升有限”
第三级: INTRA 全语料评分
- Decoder query 对全部 M 个 chunk 打分
- 选出 Top-4 + 1 个 question chunk → 5-chunk 上下文
- 标注 “可选出 S₀ 之外的 chunk,这才是关键”
底部对比条:
- Reranking: ❌ 只重排已有候选
- INTRA: ✅ 全量评分,可选新 chunk
生图 Prompt
【类型】流程对比图
【风格】sketchnote
【语言】中文
【主题】三级检索策略 — Encoder粗筛 → Decoder重排 → 全语料评分
【视觉结构】从左到右三级漏斗:第一级Encoder MaxSim选16个 → 第二级Decoder重排 → 第三级全语料评分选5个。底部对比条标注reranking vs INTRA的区别
【要标注的文字】S₀=16候选 | ColBERT类似 | reranking | 全语料评分可选出S₀之外 | Reranking:❌只重排 | INTRA:✅全量评分
【颜色】亮米白底,黑色手绘线条,三级用渐变强调(浅→深蓝色),底部对比条红绿标注
【禁止】不要照片写实/3D/UI截图
Page 5: 关键结果 — Multi-hop QA 效能
内容描述
展示 INTRA 在 multi-hop QA 上的优势。
主区域:水平柱状图(草图风格)
- 横轴:HotPotQA | 2Wiki | MuSiQue | NQ
- 每个数据集三根柱子:INTRA / Qwen3-Emb+Reranker / BM25
- INTRA 柱用深蓝,其他用浅灰
- 标注重要数值(比如 HotPotQA 上 INTRA 47.5 vs Qwen3+Reranker 44.3)
左侧标注框:
- “Multi-hop 优势更明显”
- “检索+生成共享空间 = 对齐注意力模式”
底部小字:
- “数据来自论文 Table 1, Table 2”
- “Decoder 全使用同一 T5Gemma2 4B-4B”
生图 Prompt
【类型】数据结果图
【风格】sketchnote
【语言】中文
【主题】INTRA 实验结果 — Multi-hop QA 全面领先
【视觉结构】手绘风格水平柱状图,4个数据集各3根柱(INTRA深蓝最强,Qwen3+Reranker灰,BM25浅灰),左上角标注框,底部小字数据来源
【要标注的文字】Multi-hop优势更明显 | 共享空间=对齐注意力 | 47.5 | 43.8 | 31.9 | 50.5 | 数据来自论文Table 1,2
【颜色】亮米白底,黑色手绘线条,INTRA柱深蓝,#2C5F8A,其他柱浅灰/中灰,强调框用珊瑚红
【禁止】不要照片写实/3D/真实图表截图/Excel风格