大模型评测平台研发工程师
Company Tencent
Focus Tech · Algorithm
Location 深圳
Published September 2, 2026
岗位职责
- 岗位职责;
- 负责大模型评测平台的架构设计与核心能力建设,打造稳定、高效、可扩展的评测运行底座,支持文本、语音、图像、视频及 Agent 等多类型模型和应用的评测需求;
- 负责评测任务全生命周期的工程化建设,包括环境与依赖管理、任务编排、并发调度、资源隔离、失败重试及结果管理等;
- 建设大规模评测执行能力,持续优化平台的吞吐、延迟、资源利用率和任务成功率,保障评测任务在生产环境下稳定运行且结果可复现;
- 建设评测平台的可观测与诊断体系,完善日志、指标、链路追踪、异常检测和问题归因能力,保障评测结果准确、可信、可解释;
- 跟进大模型及 Agent 技术发展,探索自动化评测、模型裁判、智能归因和 AI 辅助研发等方向,持续提升评测效率与平台智能化水平。
任职要求
- 岗位要求;
- 计算机或相关专业本科及以上学历,3年及以上后端、平台或基础设施研发经验;
- 精通 Go、Python、Java 或 C++ 中至少一种语言,具备扎实的计算机基础和良好的工程实现能力;
- 具备中大型平台或分布式系统的设计与落地经验,熟悉微服务架构、任务调度、并发控制、容错机制及性能优化;
- 熟悉网络通信、代理及外部接口访问机制,能够处理限流、超时、重试、网络隔离和第三方服务稳定性等问题;
- 具备较强的质量意识,熟悉自动化测试、可观测性和故障诊断体系,能够保障复杂平台的数据准确性与运行可靠性;
- 对大模型技术和应用有基本理解,了解模型推理、Benchmark、Prompt、RAG、Agent 或模型评测相关概念;
- 具备良好的沟通协调能力和 Owner 意识,能够在算法、平台及底层基础设施等团队之间有效推进复杂项目落地。
产品/项目
元宝
工作年限
三年以上工作经验