阿里国际站-Agentic RL环境与模型训练工程师-杭州/北京

Company Aidc

Focus Tech · Backend

Location 北京, 杭州

Published July 16, 2026

岗位职责

我们正在围绕 阿里巴巴国际站 + Accio Work 打造真实全球贸易场景的 AI Agent,覆盖买家采购、商家经营、Research、商品发布、跨平台运营、物流跟踪等复杂任务。 这个岗位聚焦 Agent rollout 环境搭建 + agentic model 训练,不是传统训练岗,也不是普通应用岗,而是把真实业务流程变成模型可交互、可学习、可优化的 environment,训练一个真正“会做事”的 Agent。

你会做什么:

  1. 搭建国际站场景下的 Agent rollout / environment,支持多步任务、工具调用、Browser/API 操作

  2. 构建 trajectory 采样、reward 计算、样本回流、任务重放等训练链路

  3. 参与 SFT / Preference / RLHF / RLAIF 等 agentic post-training 工作

  4. 研究 tool use、browser use、computer use、错误恢复、多步规划等问题

  5. 联动评测/数据/产品,形成“环境-训练-评测-回流”闭环

为什么值得来:

  1. 做真实业务里的 Agent 训练,而不是 benchmark 实验

  2. 场景复杂且稀缺:多语言 + 多工具 + 长链路任务

  3. 同时覆盖 environment、rollout、reward、training,全链路空间大

  4. 有机会定义真实商业世界中 Agent 如何被训练出来

任职要求

我们希望你具备:

  1. 3年以上机器学习 / 强化学习 / 大模型训练 / 算法工程经验

  2. 熟练 Python,有训练 pipeline 或大规模系统经验

  3. 了解 RL、trajectory、reward、policy optimization、post-training 等基本方法

  4. 对 Agent、Tool Use、Browser/Computer Use、多步任务有兴趣或经验

  5. 有 rollout system / simulator / RLHF / agent training 经验优先