岗位职责
- 按产品架构与业务要求,设计覆盖功能与非功能需求的评测策略,保障 AI/算法类产品效果符合设计预期与系统稳定性;
- 面向复杂推理、Agentic Workflows 等前沿能力构建高难度评测集;开发支持万级并发、对接训练集群的评测流水线,实现 Checkpoint 边训边评与分钟级反馈;规模化落地 LLM-as-a-Judge 解决开放式生成量化难题;对 Bad Case 做算法级归因,反馈 AI 研发团队,指导数据配比、合成数据生成、AI短板能力提升;
- 研究评测新技术方法,攻克评测复杂技术/算法问题;
- 结合 AI 行业趋势制定评测技术发展规划,提升团队技术视野与影响力。
任职要求
- 5年以上互联网/传统行业AI评测经验,含3年以上 AI/算法类产品评测经验(大模型/推荐/搜索/NLP),有基座模型评测工程经验者优先;
- 熟悉算法服务测试场景(精度验证、AB实验评估等),熟悉常用评测指标(准确率/召回率/F1-score 等),掌握 Bad Case 归因与评测数据集构建;
- 熟悉主流算法框架,熟练 Python/Java,有评测流水线/工具平台开发经验优先;
- 对新质技术敏锐度高,能快速理解 AI 产品特性,具备技术攻关与团队协作能力。
特色标签
Agent工作流、Checkpoint即时评测、F1-score、Foundation Model、Java、LLM、Python、SDK测试经验、万级并发评估、云原生、云服务、云计算、人工智能评测、保险、信贷、内容安全、准确率、分布式计算、功能测试、区块链、反洗钱、召回率、基座模型、大数据、大模型、大模型自评、大语言模型、失败样本诊断、客服、广告、开放文本生成、性能测试、推荐、搜索、支付、数据安全、智能体、智能体工作流、智能研发、模型即裁判、模型评估、测试工具、理财、电商、算法、算法效果验证、聊天机器人、自主智能流程、自动化测试、自动化测试经验、自动化评测平台、自由生成任务、自监督评测、英美留学生、营销、训练实时评估、评估流水线、评测系统、金融、错误案例根因分析、隐私计算、风控、高并发测试