阿里国际站-Agentic RL环境与模型训练工程师-杭州/北京
Company Aidc
Focus Tech · Backend
Location 北京, 杭州
Published July 16, 2026
岗位职责
我们正在围绕 阿里巴巴国际站 + Accio Work 打造真实全球贸易场景的 AI Agent,覆盖买家采购、商家经营、Research、商品发布、跨平台运营、物流跟踪等复杂任务。 这个岗位聚焦 Agent rollout 环境搭建 + agentic model 训练,不是传统训练岗,也不是普通应用岗,而是把真实业务流程变成模型可交互、可学习、可优化的 environment,训练一个真正“会做事”的 Agent。
你会做什么:
-
搭建国际站场景下的 Agent rollout / environment,支持多步任务、工具调用、Browser/API 操作
-
构建 trajectory 采样、reward 计算、样本回流、任务重放等训练链路
-
参与 SFT / Preference / RLHF / RLAIF 等 agentic post-training 工作
-
研究 tool use、browser use、computer use、错误恢复、多步规划等问题
-
联动评测/数据/产品,形成“环境-训练-评测-回流”闭环
为什么值得来:
-
做真实业务里的 Agent 训练,而不是 benchmark 实验
-
场景复杂且稀缺:多语言 + 多工具 + 长链路任务
-
同时覆盖 environment、rollout、reward、training,全链路空间大
-
有机会定义真实商业世界中 Agent 如何被训练出来
任职要求
我们希望你具备:
-
3年以上机器学习 / 强化学习 / 大模型训练 / 算法工程经验
-
熟练 Python,有训练 pipeline 或大规模系统经验
-
了解 RL、trajectory、reward、policy optimization、post-training 等基本方法
-
对 Agent、Tool Use、Browser/Computer Use、多步任务有兴趣或经验
-
有 rollout system / simulator / RLHF / agent training 经验优先