蚂蚁健康-智能体基础设施研发工程师

Campus

Company Antgroup

Focus Tech · Algorithm

Location 上海, 杭州

Published September 23, 2026

岗位职责

岗位描述 面向大模型 Agent 的训练、评测与运行场景,建设稳定、高效、可扩展的基础设施,覆盖执行环境、任务调度、数据与镜像流水线、自动化评测及开发者工具,支持 Agent 在软件工程、终端操作等复杂任务中的规模化运行。

岗位职责

根据经验与能力,参与或负责以下方向: Agent Runtime 与沙盒环境:设计和开发 Agent 执行环境,完善命令执行、文件操作、会话管理、环境隔离及资源回收机制,支持多轮交互与长时间任务运行。 任务调度与集群基础设施:建设容器化任务运行平台,优化并发调度、资源分配、镜像预热、缓存复用及故障恢复,提升任务吞吐与资源利用率。 环境与数据流水线:建设任务数据接入、镜像构建与分发、依赖管理、环境校验及版本管理流程,保障任务运行的一致性与可复现性。 Agent 评测平台:建设可扩展的评测框架,支持多类任务、Agent 和模型接入,完善测试执行、结果解析、轨迹采集与质量校验,保障评测结果可信。 SDK 与开发者工具:设计统一的服务接口、SDK 和命令行工具,打通模型、Agent、执行环境与评测服务,提升实验接入与批量运行效率。 稳定性与性能优化:完善日志、指标、链路追踪及故障诊断体系,持续优化任务成功率、启动延迟、运行成本与系统可维护性。

任职要求

任职要求

具备扎实的编程能力,不限编程语言,能够开展后端服务或系统工具的设计与开发。 掌握操作系统、计算机网络、数据结构等基础知识,理解进程管理、文件系统、并发编程与网络通信。 熟悉 Linux 开发环境及 Git 工作流,具备代码阅读、问题复现、故障定位和方案验证能力。 具备良好的工程习惯,重视功能设计、安全边界、性能评估与自动化测试。 对大模型 Agent 及其基础设施有持续兴趣或实践经验,理解模型调用、工具执行、环境交互与结果反馈的基本链路。 具备清晰的技术表达与协作能力,能够围绕实际问题推进方案落地。 加分项 熟悉 Claude Code 等前沿 Coding Agent Harness,了解其工具执行、上下文管理、权限控制与扩展机制,具有深度使用或集成开发经验。 具有 Docker、Kubernetes、容器运行时、沙盒隔离或集群调度相关经验。 具有分布式任务系统、工作流引擎、缓存系统、存储系统或 CI/CD 平台研发经验。 具有 Coding Agent、工具调用、运行轨迹采集或 Agent 框架开发经验。 熟悉 SWE-bench、Terminal-Bench 等评测体系,具有自动化测试、评测框架或数据质量保障经验。 了解大模型训练、强化学习中的环境交互、并行采样、轨迹管理或奖励反馈流程。 具有开源项目贡献,或在性能优化、稳定性治理、复杂故障排查方面有实际成果。 投递材料 简历可附代表性项目、开源贡献或技术文章,重点说明承担职责、技术难点、解决方案及实际效果。

特色标签

AI 智能体、AI 评测框架、C/C++、CLI 工具、Docker、Docker 化、Golang、Java、Kubernetes、Kubernetes 化、Linux开发/部署经验、LLM Agent、Python、Redis、中大型项目开发经验、云原生、云计算、云计算经验、作业调度、分布式经验、分布式调度、医疗、可靠性、命令行接口、基础设施、大模型智能体、安全运行环境、容器技术、工作流调度、延迟优化、开发者套件、微服务经验、性能提升、性能调优、智能体、智能体评测、智能研发、服务端开发经验、机器学习经验、沙箱环境、研发效能、系统架构设计经验、系统稳定性、终端工具、自动化测试、软件开发工具包、镜像分发流程、镜像构建流水线、镜像管理、隔离环境、集成开发包、高可用性