Company Dingtalk
Focus Tech · Backend
Location 杭州
Published August 26, 2026
负责千问办公评测平台建设,构建覆盖模型、AgentLoop、Skills多维度评测方案,设计落地高效、端到端、可量化的自动化评测Pipeline
结合业界最佳实践与 B 端办公真实业务场景,通过专家设计和数据合成等手段,动态构建高质量评测集和 LLM-as-Judge 评估器
基于离线评测和在线观测数据,与产品、技术、运营、财务团队紧密协作,驱动Agent自进化迭代,参与设计高性价比的模型调度与定价策略
建立常态化竞品评测体系,对标行业头部产品,为产品方向和技术路线决策提供支撑
本科及以上,计算机科学、软件工程、人工智能、统计学等相关专业,3年以上工程/测试工作经验
扎实的软件工程与测试能力,熟练使用 Python / Java / Go 中至少一门语言,具备复杂分布式系统的测试设计与执行经验
熟悉主流 LLM 评测基准与方法(如 HumanEval、SWE-bench、MMLU、GSM8K 等),能结合B端业务场景进行评测方案适配与设计
具备 Agent 评测或开发经验,熟悉 Context Engineering、ReAct、Function Calling、Tool Use、Planning 等核心概念,有端到端评测报告输出的实战经历
良好的数据分析与归因能力,能基于评测数据驱动质量改进,协同算法、工程团队构建 Agent 自进化闭环
自驱力强,善于独立思考与跨团队协作,乐于总结分享,对 AI 产品质量有高标准追求