AI推理平台-AI算法评测工程师-北京/杭州
Company 阿里巴巴
Focus 技术 · 测试
北京, 杭州
July 29, 2026
岗位职责
- 负责AI产品核心效果评估与精度度量:主导大模型及AI应用在业务场景下的效果评测全流程,包括构建多维度评测指标体系(如准确率、召回率、幻觉率、Rouge/BLEU及任务完成率),制定严谨的AB实验方案,并对评测数据进行深度统计与归因分析。
- 构建对抗性评测与稳定性验证体系:设计并执行覆盖边界Case、长尾分布及恶意攻击的测试用例,系统性评估模型在复杂场景下的鲁棒性、安全性与语义稳定性,输出可量化的风险评估报告。
- 推动效果回归与用户体验闭环:建立版本迭代的效果回归基线,利用自动化工具持续监控模型更新带来的精度波动;同时建立“线上数据回流-线下标注验证-模型优化”的闭环机制,推动产品体验的持续优化。
- 设计自动化评测工具与数据飞轮:开发或集成AI自动化评测脚本(如基于API的批量推理、断言校验),建设数据标注与结果分析平台,提升效果评估的效率和可复现性;主导评测数据集的构建与管理,确保数据分布的合理性与标注一致性。
任职要求
- 学历与理论基础:计算机科学、人工智能、统计学或相关专业硕士及以上学历,具备扎实的机器学习/深度学习理论基础,熟悉常见的模型评价指标(如F1-Score、PPL、METEOR、BERTScore等)及其适用场景。
- 编程与工程实现能力:熟练掌握Python/C++等编程语言,具有良好的代码规范与工程落地能力。熟悉Linux开发环境,能够利用Numpy、Pandas、Scipy等工具进行高效的评测数据处理与可视化分析。
- 评测分析与问题定位能力:具备敏锐的数据敏感度和严谨的统计学思维,熟练掌握假设检验、方差分析等数理统计方法。面对Bad Case时,具备优秀的逆向分析能力,能够准确定位精度损失的数据源头(数据偏移、模型过拟合、推理逻辑错误等)。
- 工具链与数据库操作:熟悉Redis、MySQL等数据库的基础操作,能够熟练使用Tensorboard、Weights & Biases等实验跟踪工具,具备利用Docker或脚本构建可复现评测环境的能力。
- 软素质要求:对产品质量与用户体验有极致的追求,注重细节;具备优秀的沟通能力和跨部门协作能力,能够清晰地向算法研发团队阐述评测结论与优化建议。
- AI实践经验:熟悉大模型的应用开发或效果调优,有过针对具体垂直领域构建评测集的实际经验。 加分项
- 有AI模型效果调优、指令微调(SFT)或强化学习(RLHF)中对Reward Model效果评估的经验。
- 发表过关于模型评估、基准测试(Benchmark)或测试数据增强(Data Augmentation)相关的学术论文。
- 主导或深度参与过大型AI模型的大规模效果对齐(Alignment)或红蓝对抗(Red Teaming)评估项目。
岗位标签
NEW