createrole

Recursive Self-Improvement,有边界的递归自我改进

会自我改进的数字员工队伍

白天替你干活,当场记下学到的事,夜里固化记忆。你按岗位给它出题打分,它在快照上打磨自己,超过基线的改进才等你确认。每一圈一个版本,随时可回滚。

体验平台采用审核制。留下邮箱,通过后我们发开通邮件。

干活记事固化评测代练你确认当前版本v1

干活 在自己的沙盒电脑里完成任务,交付文件。

这些能力都有,但不是重点:

  • 多轮对话
  • 任务计划
  • 沙盒终端
  • 文件交付
  • MCP 工具
  • 技能文件
  • 多模型
  • 整栈私有化

createrole 关心的是任务结束之后:今天学到的,明天还在吗?下一次会不会做得更好?

递归自我改进闭环

六个环节,每一环都是产品里真实运转的机制,都有自己的页面。

  1. 01改上下文

    记事

    干活时当场写下学到的事

    云盘里有三份它自己写的文件:我是谁、和你的相处、踩过的坑。学到你的新情况、答应了事、做错了事,当场写进去,每回合全文进入上下文。每份上限 1500 字,写超即拒。

  2. 02改记忆

    固化

    夜里把经历蒸馏成记忆

    每天一条日记,按会话实时转录。凌晨把当天经历蒸馏成认识页面,重写「和你的相处」与「踩过的坑」,更新对你的了解。抽不出值得保留的就什么都不写。

  3. 03评测体系

    夜校

    按岗位一键生成考纲与题库

    按灵魂档案里的职业定位联网调研,由出题人模型制定考纲:能力维度 × 题型 × 难度。计算题可执行验证,知识题必须引用真实出处,开放题按评分清单。练习集与真题分池,出题人与学生用不同模型。

  4. 04外部锚点

    评测

    给当前版本打一个基线分

    judge 模型对照标准答案逐题打分,每题一句评语,得到当前版本的分数。答题的模型不给自己打分。没有标准答案的题集,代练不会启动。

  5. 05候选生成

    代练

    在快照副本上打磨自己

    由你发起。先给当前灵魂打基线分,再生成候选灵魂重新评分。严格超过基线的候选才会等你裁决,低于基线自动否决,应用前本体零改动。你看到的是分数变化、改进说明和逐行差异。

  6. 06人在环上

    版本

    你点应用,版本号加一

    每个版本固定当时的模型、灵魂、技能与工具组合,写明来源。应用即 v+1;灵魂每次修订存全文,可回滚到任一版。第二天它带着新版本继续干活。

模型权重不动,改的是记忆、记事、技能与考核体系。

记忆不是聊天记录

会话记录回答「发生了什么」,日记回答「这一天做了什么」,记忆回答「以后怎么做」。召回分三层:每回合注入几条带日期的一句话钩子,需要时在终端展开全文,再不够才翻日记。

  • 教训

    犯过的错、为什么、下次怎么做

  • 大事记

    有长期意义的情节

  • 人物

    关系、偏好、禁忌、承诺

  • 认识

    对世界与业务的结论,带置信度

  • 经验

    什么任务怎么做

  • 自我

    它认为自己是谁

产品里的页面

都是体验平台里能点到的页面。

代练结果。
代练结果。 基于 v1 的 10 道题,基线 90 分,候选 97 分。左边当前灵魂,右边候选灵魂,改进说明写清改了什么。丢弃或应用,由你决定。
版本清单。
版本清单。 每个版本固定当时的模型、灵魂、技能与工具组合,写明来源。灵魂修订历史在「天性」页,可回滚到任一版。
评测。
评测。 夜校按职业定位生成的考纲与题库,judge 模型逐题打分,每题附评语。
成长面板。
成长面板。 对话页右侧:动态、天性、记忆、技能、待办、日记。每一条成长都能点开。

看它跑完一圈

一分四十八秒实录:发起代练,等候选评分,看差异,点应用,版本从 v1 到 v2。等待时段加速,未剪辑。

为什么不会越改越差

自改进系统有两个已知风险:没有外部锚点会先升后崩,评判者与生成者同源会自我确认。每一条都用结构回答,不靠提示词。

风险:自主改权重

模型权重冻结

改的是记忆、记事、技能和考核体系。模型只是目录里的一条记录,随时可换,成长资产保留。

风险:改写自己的人格

灵魂只有你能改

职业与风格的权威源在数据库,云盘上没有对应文件,沙盒内不可见不可改。代练候选必须由你点应用。

风险:自我确认

出题人与学生分离

出题人用独立的强模型档位,答题的模型不给自己打分。题库不进数字员工的上下文。

风险:越改越差

只接受超过基线的候选

每次代练先打基线分,候选必须在同一题集上更高才会出现在你面前。低于基线自动否决。

风险:不可逆

每次变化留版本

灵魂每次修订存全文快照,可回滚到任一版。夜间步骤按日只跑一次。

风险:上下文膨胀

硬闸而非软提示

记事 1500 字上限在写入侧执法。删除对话时派生的记忆与日记随之清理。

白天干活,夜里成长

闭环落到一天里。

白天对话、计划、执行、交付,待办到点自己醒来。晚上固化记忆、复盘关系与教训、更新对你的了解。第二天,昨天的教训作为记忆钩子进入第一回合。评测和代练由你决定何时发起。

一个数字员工的一天

24h
  1. 09:00派活你说:把上周的会议纪要整理成周报。它立计划、跑沙盒、交付 docx。
  2. 11:30记事你随口说周三下午开会。它把这条写进「和你的相处」。
  3. 14:40纠正你说:周报里别写具体金额。当场写进「踩过的坑」。
  4. 15:00自醒待办到点,在专属会话里自己动手,不打断你正在用的会话。
  5. 18:00日记今天每段对话已按会话实时转录成当天日记。
  6. 01:00固化把今天蒸馏成记忆页,复盘并重写「和你的相处」与「踩过的坑」。
  7. 02:00了解更新对你的了解,只写关于你这个人的事实,不写工作规程。
  8. 次日钩子新对话第一回合,昨天的教训已经作为记忆钩子注入。

以上每一步都是产品里真实运转的机制。

整栈私有化,断网也照常成长

后端、前端、沙盒服务、记忆服务,四个服务一键部署到客户内网。验收后拔掉网线,全部功能照常。

两台 DGX Spark 背对背 200GbE 直连

在两台 NVIDIA DGX Spark 上,一个科室的数字员工编制就是桌上这一摞:一台跑本地模型推理,一台跑全部应用服务,200GbE 直连。

  • 多协议模型适配层,本地 vLLM 与云端模型只是目录里的一条记录
  • 换模型免重启,出题人、夜间固化、对话可用不同档位
  • 系统级开关声明沙盒无外网,数字员工知道自己断网,不会反复重试
查看私有化方案

申请一个体验账号

体验平台审核制。告诉我们你想用它做什么,通过后发开通邮件。