INTRA 论文方法图解 — 5 张 sketchnote
论文信息
- 标题: Retrieval from Within: An Intrinsic Capability of Attention-Based Models
- 作者: Elad Hoffer, Yochai Blau, Edan Kinderman, Ron Banner, Daniel Soudry, Boris Ginsburg (NVIDIA)
- 链接: https://arxiv.org/abs/2605.05806
- 生成日期: 2026-06-06
- 风格: sketchnote(温暖科研笔记风)
- 语言: 中文
图解总览
| 序号 | 页面 | 内容 | 文件 |
|---|---|---|---|
| 1/5 | 封面总览 | INTRA vs 传统 RAG 核心差异对比 | 01-cover-intra-vs-rag.png |
| 2/5 | 核心机制 A | Attention as Retrieval — Decoder Cross-Attention 变身检索信号 | 02-attention-as-retrieval.png |
| 3/5 | 核心机制 B | 训练与推理流程 — 两次前向传播 | 03-training-and-inference.png |
| 4/5 | 核心机制 C | 三级检索策略 — Encoder粗筛→Decoder重排→全语料评分 | 04-three-level-retrieval.png |
| 5/5 | 关键结果 | Multi-hop QA 效能对比 | 05-results-multihop-qa.png |
每页详细说明
Page 1: INTRA vs 传统 RAG
左右对比布局:
- 左侧(传统 RAG): Query → 外部检索器(BM25/Dense)→ 文本 → 重编码 → 生成器。标注:分离系统、分属不同表示空间
- 右侧(INTRA): Query → T5Gemma2 Encoder → 预编码 Chunk 状态 → ① Decoder 检索前向传播 → ② 生成前向传播。标注:统一空间、注意力即检索
Page 2: Attention as Retrieval
Decoder Layer 截面图,展示 Cross-Attention 如何变成 chunk-level 检索信号:
- 输入含检索 tokens ρ₁…ρᵣ
- Cross-Attention 内部标注 Score = MaxSim(qℓ, kᵢ)
- 预编码 Chunk 池,Top-4 高亮
- 底部公式:sᵢ = Σₗ αₗ · MaxSim(qₗ, kᵢ)
Page 3: 训练与推理流程
上下分两部分:
- 训练: 仅训练 retrieval tokens ρ + 层权重 α(4K 参数 / 12 权重)。损失函数:soft cross-entropy
- 推理: 两次 Decoder 前向传播。① 对所有 M 个 chunk 评分选 Top-n → ② 生成答案
Page 4: 三级检索策略
从左到右三级漏斗:
- Encoder-side MaxSim 粗筛 → Top-16(与 ColBERT 类似)
- Decoder Reranking(提升有限)
- INTRA 全语料评分 → Top-4+1(可选出 S₀ 之外的 chunk)
底部对比:Reranking vs INTRA 的本质区别
Page 5: Multi-hop QA 结果
水平柱状图对比 INTRA / Qwen3+Reranker / BM25 在四个数据集上的表现。
方法精简总结
核心公式: sᵢ = Σₗ αₗ · MaxSim(qₗ, kᵢ)
训练参数: 4K retrieval tokens + 12 层权重 (0.1%)
推理成本: 2× Decoder 前向传播
模型: T5Gemma2 4B-4B (冻结)
相关文件
生图参数
- 模型: SDXL base 1.0
- 步数: 25
- CFG: 7.0
- 采样器: Euler
- 分辨率: 1024×768 (4:3)