岗位职责
- Agent Harness与长时任务
负责生产级 Agent Harness 核心算法与系统研发,包括上下文工程、工具调用、任务编排、状态持久化、权限控制、异常恢复和轨迹回放。
构建面向长时任务的分层记忆系统,包括工作记忆、情景记忆、语义记忆、经验记忆及长期 Artifact 管理。
重点突破 Long-horizon Planning 中的目标漂移、错误累积、上下文膨胀和决策不稳定问题。
- Agent RL与后训练
负责 Agent RL 训练和策略优化,提升 Agent 在复杂工具调用、代码生成、多步推理及多模态创作任务中的成功率与鲁棒性。
构建长轨迹任务环境与 Benchmark,建立从任务生成、轨迹采集、结果验证到策略训练的完整闭环。
开展 SFT、Reward Modeling、DPO、PPO、GRPO等训练工作,结合成功与失败轨迹实现持续策略改进。
- 多模态创作和World Model 创作链路
搭建高可用的多模态智能创作链路,实现从创意理解、文本脚本、分镜规划到图像、视频、语音和交互式世界生成的完整闭环。
结合世界模型开展 Agent 决策应用,利用世界模型进行多步前瞻、动作仿真,在执行前评估不同动作序列的潜在结果。
推动世界模型在 AI 视频、互动内容、数字人、3D场景和可交互虚拟环境中的产品化落地。
- 前沿技术预研
跟踪 Agent RL、World Models、多模态生成和交互式智能体等方向的最新进展。
快速复现和评估学术界及开源社区的前沿方法,推动有效方案在工业场景中的落地。
输出有影响力的学术或开源工作
任职要求
- 学历与基础
计算机、人工智能、数学等相关专业硕士及以上学历,具备扎实的机器学习理论基础。
精通 Python,熟悉 PyTorch 深度学习框架,具备优秀的算法工程化落地能力。
- Agent 与强化学习
深入理解 Agent 范式:熟练掌握 ReAct, Plan-and-Solve, Reflexion 等主流 Agent 架构。
精通 RL 对齐算法:有实际的 PPO, DPO, ORPO, GRPO 等算法调优经验,理解 Reward Modeling 的设计原则,能够处理稀疏奖励和多目标优化问题。
熟悉 LangGraph、LlamaIndex 或自研 Agent 框架源码,具备修改底层调度逻辑的能力。
- 多模态模型与 SFT
熟悉 SFT 全流程:具备大规模多模态指令数据的清洗、构造及增强经验,有熟练的分布式微调训练。
【加分项】
优秀的学术成果:在 NeurIPS, ICML, ICLR, CVPR, ACL 等顶级会议发表过关于 过关于 Agent RL(如决策优化、强化学习对齐)或 多模态生成(如文生图/视频、多模态对齐、可控生成)相关的高水平论文。
开源贡献:在 GitHub 上有高星的 Agent 框架、多模态模型、benchmark或 RL 训练代码库贡献。