岗位职责
- 负责面向真机 Benchmark 和数据闭环场景的 Agent 应用算法与工程落地,支撑问题诊断、评测判断、任务决策、工具调用和结果回流等关键场景。
- 负责建设 Agent Harness,支撑工具调用、Context / Memory 管理、任务编排、多 Agent 协同、运行观测、人工复核和结果回流。
- 负责构建 Agent / Harness 端到端评测能力,围绕 Grader、Advisor、工具调用正确率、多步任务成功率等指标持续优化 Agent 表现。
- 负责或参与基于闭环运行数据、人工反馈和评测结果构建训练与评测数据,支持 Agent 相关模型的微调、强化学习、蒸馏、评测和推理优化。
- 与平台、数据工具链、仿真引擎、算法和产品团队协同,推动模型能力、工具策略和 Harness 机制在实际闭环流程中协同优化。
任职要求
- 硕士及以上学历,计算机、人工智能、自动化、机器人等相关专业,3 年及以上相关工作经验。
- 熟练掌握 Python,具备良好的工程开发能力;熟悉 PyTorch / TensorFlow / JAX 等深度学习框架者优先。
- 理解大模型和 Agent 系统的基本原理,熟悉 LLM API、Reasoning、RAG、Tool Use、Function Calling、Planning、Memory、Reflection 或 Multi-Agent 等一个或多个方向。
- 具备 Agent Harness、复杂任务编排或 LLM 应用工程经验,熟悉工具调用、Context 管理、状态管理、运行观测和人工复核等工程机制。
- 熟悉 Agent 评测、数据构建、模型训练和迭代优化流程,具备微调、强化学习、蒸馏、推理优化、Grader / Advisor 或工具调用模型优化经验者优先。
- 有 Agent Harness / Runtime、LangGraph、AutoGen、OpenAI Agents SDK、MCP、工作流编排系统、多模态模型、机器人或具身智能相关经验者优先。