平台上海全职发布于
评测与自我改进工程师
负责夜校出题、judge 打分与代练的方法与实现,让数字员工的每一次改进都有可信的基线可比。
投递这个岗位邮件主题请写岗位名称,附上简历。
你会做什么
- 设计按岗位出题的评测集与评分标准,维护 judge 模型的提示与校准流程。
- 实现并改进代练:在快照副本上生成候选、重新评分、只把超过基线的改进交给用户确认。
- 建立回归门与漂移监控,回答“它有没有越改越差”这个问题。
- 把评测结果做成用户看得懂的报告与差异说明。
我们希望你
- 有 LLM 评测或数据集构建的实际经验,知道 judge 模型会怎样自我确认,并知道怎么防。
- 熟练 Python,能读懂并改动服务端代码;有统计基础,能判断一个提升是否显著。
- 对“有边界的自我改进”这个方向有自己的看法,愿意把文献结论落成工程约束。
- 写得清楚,能把方法与结论写成团队和用户都能读的文档。
加分项
- 发表过相关论文或开源过评测工具。
- 做过强化学习、程序合成或自动提示优化。
怎么投递
把简历和一段你对“agent 如何避免越改越差”的看法发到投递邮箱,主题写岗位名称。我们两个工作日内回复。