Anthropic 数据 Agent 95%准确率 — 最小成本落地
不要先复制 Anthropic 完整全栈。先做三个小动作,就能拿到大部分收益。
核心论点
普通公司落地 Data Agent 的真正起步规则,不是”先追95%“,而是先回答一个更小的问题:我能不能先让一个高频小领域,变得可定义、可找到、可验证、可更新?
最小起步的三件套
1. 标准答案 — 官方标准数据集
先收拢核心概念的公司承认的入口。
- 同一个”本月收入”,不要有十几张表都看起来能算(支付时间 vs 确认收入 vs 扣退款 vs 临时看板)
- 数据 Agent 最怕的不是不会写 SQL,是在很多相似答案里自信选错
- 先收最常问、最容易错的指标,整理成标准答案
- 收入:看哪张表、按什么时间口径、退坡规则、测试账号处理,一次说清楚
先别让 Agent 自己在一堆相似答案里找真相。
2. 离线考试 — 稳定测试题
先给 Agent 考试,再让它上线。
- 以”收入”为例,准备 30-50 道题:
- 上月收入多少?(官方表入口,有答案)
- 环比变化多少?(日期口径,可复现)
- 退费算不算?(业务规则,需逻辑)
- 试用转付费算哪天?(边界场景,需路径)
- 关键:测试题要稳定
- ❌ “今天收入多少?” — 题目每天自己变,分不清是 Agent 还是数据错了
- ✅ 固定日期 / 查官方口径 — 错题才会被稳定抓到
3. SKILL 地图 — 薄 Knowledge 路由
不是巨大的百科全书,不是万能提示词,而是一张简洁的路由地图:
用户提问 → 官方指标(先查这里)→ 指定文档(少量参考)→ 问清楚(找人补注)
- 如果问收入,先看哪里
- 如果问活跃,先看哪里
- 语义层里有官方指标 → 先用
- 没有覆盖 → 再看哪份参考文档
- 哪些旧表不能用
- 遇到退款/欺诈过滤/试用转付费 → 要不要先问清楚
薄的价值不是少写点字,而是让 Agent 不要乱找。
起步顺序
- 第一步:最小起步版 — 标准答案 + 稳定试题 + 薄 Knowledge Skill
- 第二步:看真实错误 — 用户真问什么?Agent 错在哪?测试抓住了吗?文档缺什么?
- 第三步:再加复杂度 — 语义层、更多 Skill、线上监控、对抗审查、自动修复
这些都不是第一天必须做完的事,先有闭环,再决定要不要变重。
判断架构轻重的五个约束
| 问题 | 可以轻一点 | 必须重一点 |
|---|---|---|
| Q1. 今天要答对吗? | 内部探索 | 财务、合规、董事会 |
| Q2. 业务会复杂吗? | 少产品、少用户 | 多团队、多口径 |
| Q3. 谁在看答案? | 数据科学家(会验算) | 业务、管理层(只看结论) |
| Q4. 成本能承受吗? | 低成本、快回答 | 贵一点但慢一点 |
| Q5. 权限能放开吗? | 限定范围 Agent | 敏感数据、强审计 |
关键洞察
- 准确率不是免费的,要决定哪些场景值得贵
- Agent 拿到的上下文越多越容易答好,但权限风险也越大
- 很多公司不能默认做一个全能 Agent,而是多个限定范围的 Agent(销售/产品/财务各司其职)
最小可落地版本
- 选五个核心指标
- 每个指标写清楚官方口径
- 准备三十道常见问题测试题
- 给 Agent 一个薄 Knowledge Skill:先查哪里 → 查不到再看哪里 → 什么情况必须先问
如果连一个指标的官方来源、测试题和路由规则都没有,就把整个数仓接给 Agent,那不是在做数据智能,是在让 AI 更快地放大组织里原本就没整理清楚的混乱。