createrole

约 3 分钟

为什么我们把递归自我改进收敛成一个有边界的闭环

RSI 从思想实验变成了工程主流,但几乎所有能跑起来的工作都是「有界自我精炼」。createrole 明确站在这一侧:模型权重不动,改的是记忆、记事、技能和考核体系,人在环上,每一步可回滚。

  • RSI
  • 方法论
  • 成长闭环

2026 年的 AI agent 产品,能力清单几乎一致:多轮对话、任务计划、工具调用、沙盒执行、文件交付、MCP 接入、本地部署。这些是入场券,不再是差异。真正没被解决的问题是:agent 今天学到的东西,明天还在吗?下一次它会不会做得更好?

RSI 从假想到工程

RSI(Recursive Self-Improvement,递归自我改进)过去是 AI 安全讨论里的假想话题。2025 到 2026 年,它变成了可复现的工程路线:Darwin Gödel Machine、AlphaEvolve、SEAL 各自拿出量化收益;「harness 自改进」范式主张不动模型权重,让 agent 从自己的执行轨迹里挖失败、提修改、过回归门再合入。

覆盖上千篇文献的综述给出了一个清醒的结论:几乎所有已发表的工作都属于有界自我精炼,即对着固定的外部评估器做收敛式改进。严格意义上的 RSI,也就是自主改权重、没有外部锚点,仍然是安全讨论的对象,不是工程现实。

同一批文献反复给出两条警告:

  1. 没有外部锚定的纯闭环自改进,默认走向「先升后崩」。
  2. 生成器和评判器共享权重,会产生自确认回路。

createrole 站在哪一侧

我们明确站在有界自我精炼这一侧。模型权重冻结,改的是四样东西:

改什么在产品里是什么谁能改
上下文数字员工自己写的三册记事:关于自己、和你的相处、踩过的坑它自己,1500 字硬上限
记忆夜间固化出的六型认识页面夜间任务,按日只跑一次
技能云盘里的技能文件它自己写、商城安装
考核体系按岗位生成的考纲与题库出题人模型,人工可抽查改题

灵魂,也就是职业与风格,是数字员工的天性。它的权威源在数据库,云盘上没有对应文件,沙盒内不可见不可改。这是唯一没有旁路的注入防护,也堵死了「agent 改写自己人格」这条最危险的路。

闭环长什么样

把它落到一天里,就是六个环节:

  1. 干活:在自己的沙盒电脑里完成任务,交付文件。
  2. 记事:学到的、答应的、做错的,当场写进自己的记事。
  3. 固化:凌晨把今天蒸馏成记忆页,复盘关系与教训,更新对你的了解。
  4. 评测:夜校按岗位出题,judge 模型对照人工标准答案给当前版本打基线分。
  5. 代练:在快照副本上生成候选灵魂并重新评分,只有严格超过基线的候选才会等你裁决。
  6. 你确认:看改进说明和逐行差异,点应用,版本号加一。

对文献里的两条警告,我们的回答是结构性的:评测题集必须有人工标准答案,答题的模型从不给自己打分,出题人和学生用不同模型;低于基线的候选自动否决,本体零改动;灵魂每次修订存全文快照,修订历史可回滚到任一版。

我们不宣称什么

我们不宣称「AI 自己变聪明」。我们交付的是一个更朴素的承诺:一个数字员工,用得越久越懂你的业务、越懂你本人,而且每一步成长都能翻出来看。