首屏
一句话:我把「费曼学习法」里唯一缺失的部件——一个会追问的同伴——做成了产品:学习者讲,AI 扮学生追问。
三个数:43 项自动化评测指标 | 13 个业务端点 | 非直接答疑率 100%
主视觉:图 1 功能模块图
关键不在于提示词写得好,而在于三件套——显式四阶段状态机 + RAG 讲义边界 + 43 项自动化评测——把概率性的模型行为约束成可度量、可回归的教学行为。
S0 产品形态:一次会话长什么样
这是一个学习应用:你上传一份讲义(PDF/TXT/MD 或粘贴文本),系统抽出 3–6 个概念,你选一个开始「你讲、AI 扮学生追问」。一次会话走四屏:
[1] 上传讲义 → [2] 选概念 → [3] 对练(四阶段) → [4] 掌握度总结卡
一轮的真实质感(样例):
- 你(扮演老师):「鲁迅没有直接讲道理,而是编了一个『穷青年得了一所大宅子』的比喻……」
- AI 学生追问:「那……他为什么先写不敢进门的孱头、放火烧光的昏蛋、躺进去吸鸦片的废物?这三个形象在这个比喻里各自在干什么?」
- 你卡壳时:它不给答案,而是升脚手架 L1(思考提示)→ L2(拆解问题)→ L3(选择题/两难辨析);仍不行则阶段回退一次。
- 通关时:产出掌握度卡(前后对比 / 补上的漏洞 / 仍待巩固 / 迁移能力 / 过程数据 / 引用清单),每个「补上的漏洞」都附你的原话作为证据。
(四屏完整流转与样例对话见图 07。)
S1 需求与洞察
费曼学习法有效,但它有一个隐藏前提:有一个会追问的同伴。自学者恰恰没有这个同伴。
- 现有方案都补不上这块:闪卡只覆盖低阶事实记忆;网课与重读制造「解释性深度错觉」(误以为看懂即掌握);通用答疑模型习惯性给长篇标准答案,剥夺主动思考。
- 关键洞察来自实证:学习者偏好打字而非语音,因为键盘输入提供了组织语言的缓冲时间。 → 由此推出三条产品纪律:不设倒计时、不催促、卡壳时给脚手架而不是给答案——保护思考时间。
S2 市场与现状
| 现有方案 | 失效原因 |
|---|---|
| Anki / 闪卡 | 只测事实记忆,检验不了逻辑推导与因果联系 |
| 网课 / 重读笔记 | 单向输入,制造「看懂即掌握」的错觉 |
| 通用 ChatGPT 答疑 | 给标准答案,剥夺学习者主动思考 |
| 搜题软件 | 直接给答案与解题步骤,与「以教促学」背道而驰 |
| 费曼学习法(无工具) | 以「有会追问的同伴」为前提,自学者没有 |
空白点清晰:一个不知疲倦、有讲义金标准、只会追问不会替你答的虚拟同伴。这是费曼法在自学场景下唯一缺失、且大模型恰好能低成本充当的部件。
S3 方案与规划
MVP 只做闭环四屏(上传讲义 → 选概念 → 四阶段对练 → 掌握度总结卡),砍掉展示型首页与社区大厅。
| 模块 | 职责 |
|---|---|
| M1 文档摄取与知识库 | 把讲义变成有边界、可检索、可引用的知识域 |
| M2 费曼对练状态机 | 显式控制四阶段流转,保证节奏不失控 |
| M3 追问与漏洞诊断 | 生成聚焦追问、诊断漏洞、执行护栏 |
| M4 脚手架与容错 | 卡壳时降级与提示,防挫败退出 |
| M5 掌握度报告 | 通关产物:正向激励 + 可复核学习证据 |
| M6 非功能与验收 | 性能、隐私、边界、验收清单 |
| 评测体系(横切) | 43 项指标 + 黄金集 + Judge 流水线 |
明确不做(不是能力限制,是教学法边界与范围收敛):代做运算/代写证明、语音输入、拍照手写、账号与支付、模型微调。
S4 开发与迭代
采用 vibe coding 循环:需求澄清 → 方案设计 → 任务规划 → 实现 → 验证 → 交付沉淀。几个从坏到好的真实迭代:
- 脚手架使用率 0.022 → 0.283:真因不是口径,是两个产品缺陷叠加——「连续卡壳→放弃」的规则排在「追问超限→升脚手架」前面,学生一说「不知道」就被直接放弃;且评测传给教练的是决策前的 state。修好后新增断言防回归。
- 情境追问比例 0.600 → 1.000:根因是阶段 1 提示词里明确写着「顺着他的措辞追问『这个词具体指什么』」——那一句直接制造了不达标。删掉即修复。
- 首字延迟 −44%:
reasoning_effort与enable_thinking=false键名不同互不覆盖,请求体同时带两个参数、后者被架空。用单变量实验验证后修复,质量全部保持。 - 一次自我推翻:曾把「开重排让指标转达标」当作收益,重复跑基线后发现关重排同样是该值——那是噪声。定案重排默认关,并立下规矩:看指标之前先看它在历史上的跳动区间。
评估器双链路(JEV):买到的是概率,不是成本。 评估器(决定「这轮该不该推进」的那次调用)有两条可切换实现:默认 LLM,可切 JEV(只返回类型化判断与概率、不生成文本的窄判断模型)。实测评估器中位延迟 2410ms → 405ms(快 6×)、判定持平;更重要的是概率有区分度——LLM 自报置信度从不下 0.55,低置信澄清长期测不到(n=0),换 JEV 后 n=11 且全对,已知边界用例在概率分布里直接可见。两条工程教训:任何「A 比 B 慢」的结论先排除连接差异(连接复用把真实值救了回来);并发拆分实测不划算。JEV 已接入、可切换、默认关(订阅额度用不完、没必要切)——这是算清成本收益后的决定,不是未完成项。
指标趋势(图 6):RUN-015→023 的 C-1 / C-4 / L3-4 / L3-7 与规则型合计。单次运行的差异不能当因果,我看区间与趋势。
S5 测评与护城河
三层指标,回答三个问题:找对了吗(L1/检索)、像不像费曼老师(L2 教学法)、真的学懂了吗/跑得起吗(L3 成效与系统)。
- 43 项 = 33 规则型 + 10 Judge 型。规则型零 LLM 成本、100% 可复现;Judge 型先校准再使用(二元一致率 1.000)。
- 黄金集四类用例:单轮 28 / 会话级 5 / 选题 8 / 公式专项 5;每条用例带一个「可能失败的前提断言」,前提不成立即报错。
- 硬约束而非统计指标:引用可核查率、证据可核查率 = 1.00(出现一条就是 bug);过早通关率 0.000;非直接答疑率 1.000。
- 变更门槛:改提示词必须跑全量并满足「L2 全达标、L1 不劣化 >0.3 分」;改评分逻辑可用 rescore 零 LLM 成本重算。
- 诚实报区间:北极星通关率样本仅 2 条 happy path,真实区间 0.5–1.0,对外报区间不报单点。
S6 交付与展望
- 已交付:后端 12,782 行 Python + 13 端点 + SSE;评测流水线可重复跑(24 轮 RUN 记录);掌握度卡与 trace 可导出。
- 未开工(有意的产品纪律):前端。视觉基线(原型)已获认可、角色形态未定之前开工返工成本更高——这不是进度慢,是范围纪律。
- 方法论沉淀:五篇 ADR 把重复出现的事故收成可执行规则(如「每个指标必须回答分子/分母/判据,键名缺失即报错」),而非五个孤立 bug 修复。
- 下一步:前端四屏 + 角色、会话状态外置、单测与 CI、成本指标补全。