高斯可 • AI Product Manager 认知科学 × 产品 × 组织
XI'AN & REMOTE | --:-- CST krka_work@163.com
Case Study

2026.09 – 至今 | 独立产品 / 独立开发

agentfey · 费曼学伴

让 AI 扮学生追问,把「以教促学」做成可度量、可回归的产品

在研(后端与评测完整,前端待开工)

43
自动化评测指标
33 项规则型(零 LLM、可复现)+ 10 项 Judge 型(先校准再使用)
13
业务端点
FastAPI + SSE 流式,上传→抽概念→四阶段对练→掌握度卡全链路
100%
非直接答疑率
产品定义级护栏:只追问、不替答,代码层+Judge 双轨守
405ms
评估器中位延迟(JEV 链路)
2410ms → 405ms(快 6×);真正买到的是「概率区分度」,不是成本
Diagrams
功能模块图:六个功能模块 + 横切评测体系
功能模块图:六个功能模块 + 横切评测体系
四阶段状态机与「三轮没过」兜底链
四阶段状态机与「三轮没过」兜底链
单轮七步时序:护栏→检索→评估器→状态机→教练→护栏→流式
单轮七步时序:护栏→检索→评估器→状态机→教练→护栏→流式
摄取双通道路由:文本层 vs OCR
摄取双通道路由:文本层 vs OCR
评测链路:黄金集→驱动→规则/Judge→RUN 报告
评测链路:黄金集→驱动→规则/Judge→RUN 报告
指标趋势(RUN-015→023):看区间与趋势,不看单点
指标趋势(RUN-015→023):看区间与趋势,不看单点
产品形态:闭环四屏与一次真实会话流(含样例对话)
产品形态:闭环四屏与一次真实会话流(含样例对话)
Media
Deep Read

首屏

一句话:我把「费曼学习法」里唯一缺失的部件——一个会追问的同伴——做成了产品:学习者讲,AI 扮学生追问。

三个数:43 项自动化评测指标 | 13 个业务端点 | 非直接答疑率 100%

主视觉:图 1 功能模块图

关键不在于提示词写得好,而在于三件套——显式四阶段状态机 + RAG 讲义边界 + 43 项自动化评测——把概率性的模型行为约束成可度量、可回归的教学行为。

S0 产品形态:一次会话长什么样

这是一个学习应用:你上传一份讲义(PDF/TXT/MD 或粘贴文本),系统抽出 3–6 个概念,你选一个开始「你讲、AI 扮学生追问」。一次会话走四屏:

[1] 上传讲义  →  [2] 选概念  →  [3] 对练(四阶段)  →  [4] 掌握度总结卡

一轮的真实质感(样例):

  • 你(扮演老师):「鲁迅没有直接讲道理,而是编了一个『穷青年得了一所大宅子』的比喻……」
  • AI 学生追问:「那……他为什么先写不敢进门的孱头、放火烧光的昏蛋、躺进去吸鸦片的废物?这三个形象在这个比喻里各自在干什么?」
  • 你卡壳时:它不给答案,而是升脚手架 L1(思考提示)→ L2(拆解问题)→ L3(选择题/两难辨析);仍不行则阶段回退一次。
  • 通关时:产出掌握度卡(前后对比 / 补上的漏洞 / 仍待巩固 / 迁移能力 / 过程数据 / 引用清单),每个「补上的漏洞」都附你的原话作为证据。

(四屏完整流转与样例对话见图 07。)

S1 需求与洞察

费曼学习法有效,但它有一个隐藏前提:有一个会追问的同伴。自学者恰恰没有这个同伴。

  • 现有方案都补不上这块:闪卡只覆盖低阶事实记忆;网课与重读制造「解释性深度错觉」(误以为看懂即掌握);通用答疑模型习惯性给长篇标准答案,剥夺主动思考。
  • 关键洞察来自实证:学习者偏好打字而非语音,因为键盘输入提供了组织语言的缓冲时间。 → 由此推出三条产品纪律:不设倒计时、不催促、卡壳时给脚手架而不是给答案——保护思考时间。

S2 市场与现状

现有方案失效原因
Anki / 闪卡只测事实记忆,检验不了逻辑推导与因果联系
网课 / 重读笔记单向输入,制造「看懂即掌握」的错觉
通用 ChatGPT 答疑给标准答案,剥夺学习者主动思考
搜题软件直接给答案与解题步骤,与「以教促学」背道而驰
费曼学习法(无工具)以「有会追问的同伴」为前提,自学者没有

空白点清晰:一个不知疲倦、有讲义金标准、只会追问不会替你答的虚拟同伴。这是费曼法在自学场景下唯一缺失、且大模型恰好能低成本充当的部件。

S3 方案与规划

MVP 只做闭环四屏(上传讲义 → 选概念 → 四阶段对练 → 掌握度总结卡),砍掉展示型首页与社区大厅。

模块职责
M1 文档摄取与知识库把讲义变成有边界、可检索、可引用的知识域
M2 费曼对练状态机显式控制四阶段流转,保证节奏不失控
M3 追问与漏洞诊断生成聚焦追问、诊断漏洞、执行护栏
M4 脚手架与容错卡壳时降级与提示,防挫败退出
M5 掌握度报告通关产物:正向激励 + 可复核学习证据
M6 非功能与验收性能、隐私、边界、验收清单
评测体系(横切)43 项指标 + 黄金集 + Judge 流水线

明确不做(不是能力限制,是教学法边界与范围收敛):代做运算/代写证明、语音输入、拍照手写、账号与支付、模型微调。

S4 开发与迭代

采用 vibe coding 循环:需求澄清 → 方案设计 → 任务规划 → 实现 → 验证 → 交付沉淀。几个从坏到好的真实迭代:

  • 脚手架使用率 0.022 → 0.283:真因不是口径,是两个产品缺陷叠加——「连续卡壳→放弃」的规则排在「追问超限→升脚手架」前面,学生一说「不知道」就被直接放弃;且评测传给教练的是决策前的 state。修好后新增断言防回归。
  • 情境追问比例 0.600 → 1.000:根因是阶段 1 提示词里明确写着「顺着他的措辞追问『这个词具体指什么』」——那一句直接制造了不达标。删掉即修复。
  • 首字延迟 −44%:reasoning_effort 与 enable_thinking=false 键名不同互不覆盖,请求体同时带两个参数、后者被架空。用单变量实验验证后修复,质量全部保持。
  • 一次自我推翻:曾把「开重排让指标转达标」当作收益,重复跑基线后发现关重排同样是该值——那是噪声。定案重排默认关,并立下规矩:看指标之前先看它在历史上的跳动区间。

评估器双链路(JEV):买到的是概率,不是成本。 评估器(决定「这轮该不该推进」的那次调用)有两条可切换实现:默认 LLM,可切 JEV(只返回类型化判断与概率、不生成文本的窄判断模型)。实测评估器中位延迟 2410ms → 405ms(快 6×)、判定持平;更重要的是概率有区分度——LLM 自报置信度从不下 0.55,低置信澄清长期测不到(n=0),换 JEV 后 n=11 且全对,已知边界用例在概率分布里直接可见。两条工程教训:任何「A 比 B 慢」的结论先排除连接差异(连接复用把真实值救了回来);并发拆分实测不划算。JEV 已接入、可切换、默认关(订阅额度用不完、没必要切)——这是算清成本收益后的决定,不是未完成项。

指标趋势(图 6):RUN-015→023 的 C-1 / C-4 / L3-4 / L3-7 与规则型合计。单次运行的差异不能当因果,我看区间与趋势。

S5 测评与护城河

三层指标,回答三个问题:找对了吗(L1/检索)、像不像费曼老师(L2 教学法)、真的学懂了吗/跑得起吗(L3 成效与系统)。

  • 43 项 = 33 规则型 + 10 Judge 型。规则型零 LLM 成本、100% 可复现;Judge 型先校准再使用(二元一致率 1.000)。
  • 黄金集四类用例:单轮 28 / 会话级 5 / 选题 8 / 公式专项 5;每条用例带一个「可能失败的前提断言」,前提不成立即报错。
  • 硬约束而非统计指标:引用可核查率、证据可核查率 = 1.00(出现一条就是 bug);过早通关率 0.000;非直接答疑率 1.000。
  • 变更门槛:改提示词必须跑全量并满足「L2 全达标、L1 不劣化 >0.3 分」;改评分逻辑可用 rescore 零 LLM 成本重算。
  • 诚实报区间:北极星通关率样本仅 2 条 happy path,真实区间 0.5–1.0,对外报区间不报单点。

S6 交付与展望

  • 已交付:后端 12,782 行 Python + 13 端点 + SSE;评测流水线可重复跑(24 轮 RUN 记录);掌握度卡与 trace 可导出。
  • 未开工(有意的产品纪律):前端。视觉基线(原型)已获认可、角色形态未定之前开工返工成本更高——这不是进度慢,是范围纪律。
  • 方法论沉淀:五篇 ADR 把重复出现的事故收成可执行规则(如「每个指标必须回答分子/分母/判据,键名缺失即报错」),而非五个孤立 bug 修复。
  • 下一步:前端四屏 + 角色、会话状态外置、单测与 CI、成本指标补全。