Anthropic 数据 Agent 95%准确率 — 最小成本落地

不要先复制 Anthropic 完整全栈。先做三个小动作,就能拿到大部分收益。

核心论点

普通公司落地 Data Agent 的真正起步规则,不是”先追95%“,而是先回答一个更小的问题:我能不能先让一个高频小领域,变得可定义、可找到、可验证、可更新?

最小起步的三件套

1. 标准答案 — 官方标准数据集

先收拢核心概念的公司承认的入口

  • 同一个”本月收入”,不要有十几张表都看起来能算(支付时间 vs 确认收入 vs 扣退款 vs 临时看板)
  • 数据 Agent 最怕的不是不会写 SQL,是在很多相似答案里自信选错
  • 先收最常问、最容易错的指标,整理成标准答案
  • 收入:看哪张表、按什么时间口径、退坡规则、测试账号处理,一次说清楚

先别让 Agent 自己在一堆相似答案里找真相。

2. 离线考试 — 稳定测试题

先给 Agent 考试,再让它上线。

  • 以”收入”为例,准备 30-50 道题:
    • 上月收入多少?(官方表入口,有答案)
    • 环比变化多少?(日期口径,可复现)
    • 退费算不算?(业务规则,需逻辑)
    • 试用转付费算哪天?(边界场景,需路径)
  • 关键:测试题要稳定
    • ❌ “今天收入多少?” — 题目每天自己变,分不清是 Agent 还是数据错了
    • ✅ 固定日期 / 查官方口径 — 错题才会被稳定抓到

3. SKILL 地图 — 薄 Knowledge 路由

不是巨大的百科全书,不是万能提示词,而是一张简洁的路由地图

用户提问 → 官方指标(先查这里)→ 指定文档(少量参考)→ 问清楚(找人补注)
  • 如果问收入,先看哪里
  • 如果问活跃,先看哪里
  • 语义层里有官方指标 → 先用
  • 没有覆盖 → 再看哪份参考文档
  • 哪些旧表不能用
  • 遇到退款/欺诈过滤/试用转付费 → 要不要先问清楚

薄的价值不是少写点字,而是让 Agent 不要乱找

起步顺序

  1. 第一步:最小起步版 — 标准答案 + 稳定试题 + 薄 Knowledge Skill
  2. 第二步:看真实错误 — 用户真问什么?Agent 错在哪?测试抓住了吗?文档缺什么?
  3. 第三步:再加复杂度 — 语义层、更多 Skill、线上监控、对抗审查、自动修复

这些都不是第一天必须做完的事,先有闭环,再决定要不要变重。

判断架构轻重的五个约束

问题可以轻一点必须重一点
Q1. 今天要答对吗?内部探索财务、合规、董事会
Q2. 业务会复杂吗?少产品、少用户多团队、多口径
Q3. 谁在看答案?数据科学家(会验算)业务、管理层(只看结论)
Q4. 成本能承受吗?低成本、快回答贵一点但慢一点
Q5. 权限能放开吗?限定范围 Agent敏感数据、强审计

关键洞察

  • 准确率不是免费的,要决定哪些场景值得贵
  • Agent 拿到的上下文越多越容易答好,但权限风险也越大
  • 很多公司不能默认做一个全能 Agent,而是多个限定范围的 Agent(销售/产品/财务各司其职)

最小可落地版本

  1. 五个核心指标
  2. 每个指标写清楚官方口径
  3. 准备三十道常见问题测试题
  4. 给 Agent 一个薄 Knowledge Skill:先查哪里 → 查不到再看哪里 → 什么情况必须先问

如果连一个指标的官方来源、测试题和路由规则都没有,就把整个数仓接给 Agent,那不是在做数据智能,是在让 AI 更快地放大组织里原本就没整理清楚的混乱。