晓天衡宇-大模型评测集工程师-Agent评测方向Company AlibabaFocus Tech · AlgorithmLocation 北京Published August 14, 2026岗位职责 环境与任务建模:把制造、金融、游戏、能源的真实业务流程拆成 agent 可交互环境与可评测任务,定义状态/动作空间、状态转移、终止条件与难度分层。 工具与沙箱:将领域仿真器、求解器与生产力工具封装为统一环境接口,做到确定性复现、快照回滚与并发 rollout。 奖励与判据设计:程序化判定优先、rubric judge 兜底,先判物理与业务可行性再算最优性 gap,区分"看起来对"与真正可行。 任务合成:建参数化生成器批量派生任务实例及 ground truth,注入扰动与陷阱样本,把通过率控制在 30%–70%。 质控与交付:制定标注规范、把控信度效度,管控污染泄漏与任务退役,与算法团队对齐接口与奖励口径,支撑评测、SFT 与 RL。 任职要求 领域背景:至少在制造工程、金融、游戏研发或能源中的一个方向有 3 年以上实际业务经验,能独立判断一个交付物在工程或业务上是否真的可行。 工程能力:Python 熟练,有仿真器、求解器、引擎或数据平台的封装与二次开发经验,能搭出可复现、可并发的沙箱环境。 评测方法:理解可验证奖励与 LLM judge 的边界,能设计程序化判定逻辑,熟悉信度效度、污染管控与难度分层等基本手段。 数据与标注:有评测集或训练数据的构建与质控经验,能写清标注规范并管理多人标注一致性。 协作与迭代:能与算法团队对齐接口与奖励口径,依据模型表现主动迭代任务,理解评测、SFT 与 RL 三类下游用途的差异。 加分项:有 LLM benchmark 相关项目、论文或开源贡献;熟悉两个及以上上述行业领域。