createrole

约 2 分钟

夜校、评测、代练:一个数字员工怎样在一小时内从 90 分到 97 分

拿一位数据分析师数字员工做例子,走一遍产品里的闭环:按岗位生成题库,judge 模型打基线分,在快照副本上代练出候选,人工裁决后进入版本历史。

  • 夜校
  • 评测
  • 代练
  • 实录

这篇文章对应官网首页那段 1 分 48 秒的实录。主角是沈图南,一位数据分析师数字员工,负责线索、转化漏斗与经营周报。

第一步:夜校出题

打开它的「评测」页,点「生成题库」。出题人模型先按灵魂档案里的职业定位联网调研,再制定一版考纲:能力维度乘以题型乘以难度,每个格子里填题数。

题目分三级锚定:

  • 可执行验证:计算、对账类,答案确定性可判。
  • 检索锚定:标准答案必须引用真实检索出处,引不到出处的题直接丢弃,不降级。
  • 评审清单:开放交付物按清单逐项打勾,配合人工抽查。

生成的题直接落进题库,练习集与真题分池。所有题都可以改题、改池、停用,这就是人工抽查的入口。

第二步:评测打基线

点「发起评测」。系统用当前版本冻结的灵魂作为系统提示,逐题作答,judge 模型对照标准答案给出 0 到 100 的分数和一句评语。答题的模型从不给自己打分。

沈图南这一轮 10 道题,基线 90 分。评语里能看到扣分点:有些回答展开得多,但没有紧扣标准答案的核心表述。

第三步:代练

切到「代练」页,点「发起代练」。代练在快照副本上进行:先复用评测题集给当前灵魂打基线分,再让训练模型拿着每道题的问题、标准答案、基线回答摘录和评语,写一段改进说明和一份完整的候选灵魂,然后用同一个 judge 给候选重新评分。

约三分钟后,结果卡片出现:90 到 97。改进说明写的是「在保持严谨克制风格下,强化先给标准口径、链路五环、阈值处置、可视化首选、归因监控等可评分硬约束」。左边是基线灵魂,右边是候选灵魂,逐行可比。

规则只有一条:候选分数必须严格高于基线,否则自动否决,本体没有任何改动。

第四步:你来裁决

点「应用」。候选灵魂通过唯一的灵魂写入路径落库,「版本」页多出一条 v2,来源标注为代练,附带分数变化与运行编号。灵魂修订历史里保留 v1 的全文,随时可以回滚到任一版。

第二天,沈图南带着 v2 继续干活,闭环从头再来。

几个诚实的边界

  • 夜校和代练目前都由用户手动发起,不会在夜里自动跑。夜里只做记忆固化、复盘与画像更新。
  • 评测目前是模型直接作答,还没有让数字员工在沙盒里跑完整的 agent loop 考试。
  • 代练改的只是灵魂,不改技能、不改记忆、不改权重。