INTRA 论文方法图解 — 5 张 sketchnote

论文信息

  • 标题: Retrieval from Within: An Intrinsic Capability of Attention-Based Models
  • 作者: Elad Hoffer, Yochai Blau, Edan Kinderman, Ron Banner, Daniel Soudry, Boris Ginsburg (NVIDIA)
  • 链接: https://arxiv.org/abs/2605.05806
  • 生成日期: 2026-06-06
  • 风格: sketchnote(温暖科研笔记风)
  • 语言: 中文

图解总览

序号页面内容文件
1/5封面总览INTRA vs 传统 RAG 核心差异对比01-cover-intra-vs-rag.png
2/5核心机制 AAttention as Retrieval — Decoder Cross-Attention 变身检索信号02-attention-as-retrieval.png
3/5核心机制 B训练与推理流程 — 两次前向传播03-training-and-inference.png
4/5核心机制 C三级检索策略 — Encoder粗筛→Decoder重排→全语料评分04-three-level-retrieval.png
5/5关键结果Multi-hop QA 效能对比05-results-multihop-qa.png

每页详细说明

Page 1: INTRA vs 传统 RAG

左右对比布局:

  • 左侧(传统 RAG): Query → 外部检索器(BM25/Dense)→ 文本 → 重编码 → 生成器。标注:分离系统、分属不同表示空间
  • 右侧(INTRA): Query → T5Gemma2 Encoder → 预编码 Chunk 状态 → ① Decoder 检索前向传播 → ② 生成前向传播。标注:统一空间、注意力即检索

Page 2: Attention as Retrieval

Decoder Layer 截面图,展示 Cross-Attention 如何变成 chunk-level 检索信号:

  • 输入含检索 tokens ρ₁…ρᵣ
  • Cross-Attention 内部标注 Score = MaxSim(qℓ, kᵢ)
  • 预编码 Chunk 池,Top-4 高亮
  • 底部公式:sᵢ = Σₗ αₗ · MaxSim(qₗ, kᵢ)

Page 3: 训练与推理流程

上下分两部分:

  • 训练: 仅训练 retrieval tokens ρ + 层权重 α(4K 参数 / 12 权重)。损失函数:soft cross-entropy
  • 推理: 两次 Decoder 前向传播。① 对所有 M 个 chunk 评分选 Top-n → ② 生成答案

Page 4: 三级检索策略

从左到右三级漏斗:

  1. Encoder-side MaxSim 粗筛 → Top-16(与 ColBERT 类似)
  2. Decoder Reranking(提升有限)
  3. INTRA 全语料评分 → Top-4+1(可选出 S₀ 之外的 chunk)

底部对比:Reranking vs INTRA 的本质区别

Page 5: Multi-hop QA 结果

水平柱状图对比 INTRA / Qwen3+Reranker / BM25 在四个数据集上的表现。

方法精简总结

核心公式: sᵢ = Σₗ αₗ · MaxSim(qₗ, kᵢ)
训练参数: 4K retrieval tokens + 12 层权重 (0.1%)
推理成本: 2× Decoder 前向传播
模型: T5Gemma2 4B-4B (冻结)

相关文件

生图参数

  • 模型: SDXL base 1.0
  • 步数: 25
  • CFG: 7.0
  • 采样器: Euler
  • 分辨率: 1024×768 (4:3)