createrole

平台上海全职发布于

评测与自我改进工程师

负责夜校出题、judge 打分与代练的方法与实现,让数字员工的每一次改进都有可信的基线可比。

投递这个岗位邮件主题请写岗位名称,附上简历。

你会做什么

  • 设计按岗位出题的评测集与评分标准,维护 judge 模型的提示与校准流程。
  • 实现并改进代练:在快照副本上生成候选、重新评分、只把超过基线的改进交给用户确认。
  • 建立回归门与漂移监控,回答“它有没有越改越差”这个问题。
  • 把评测结果做成用户看得懂的报告与差异说明。

我们希望你

  • 有 LLM 评测或数据集构建的实际经验,知道 judge 模型会怎样自我确认,并知道怎么防。
  • 熟练 Python,能读懂并改动服务端代码;有统计基础,能判断一个提升是否显著。
  • 对“有边界的自我改进”这个方向有自己的看法,愿意把文献结论落成工程约束。
  • 写得清楚,能把方法与结论写成团队和用户都能读的文档。

加分项

  • 发表过相关论文或开源过评测工具。
  • 做过强化学习、程序合成或自动提示优化。

怎么投递

把简历和一段你对“agent 如何避免越改越差”的看法发到投递邮箱,主题写岗位名称。我们两个工作日内回复。

评测与自我改进工程师

邮件主题请写岗位名称,附上简历。

投递这个岗位