数据技术及产品部-大模型RL Data工程师-- Life Science / Chemistry(AI for Science)
Company Alibaba
Focus Tech · Algorithm
Location 杭州
Published September 22, 2026
岗位职责
主导大模型「AI for Science」中生命科学与化学方向的数据体系建设,覆盖数据生产、模型评测与质量管控全链路,以可验证奖励(verifiable reward)为核心,定义模型在生物、化学场景下的科学知识理解、科学推理、工具调用与长程科研任务执行的能力边界,构建高质量、可自动判分、可复现的标注与评测数据集。具体包括:
- 能力体系与标准制定:从 0 到 1 搭建生命科学/化学评测体系,完成能力维度拆解(科学知识问答与文献理解、假设生成、实验与合成路线设计、分子/序列/结构分析、多步科研工作流执行、结果验证与错误纠正)、任务难度分级、标注规范与评分标准,制定 rubric 与金标准,沉淀查重去污、难度校准、一致性审核的可复用工具链。
- 数据生产与标注:设计贴近真实科研流程的任务与实例(结构预测、序列与基因组分析、单细胞与图谱数据解读、分子性质预测与逆合成路线设计、数据库检索 PDB/UniProt/ChEMBL、生信分析、文献综述与 notebook 计算),组织专家标注与示范,产出金标准与失败案例;与化学、生物实验团队协作打通「湿实验 / 计算」数据闭环,将真实实验结果——尤其是失败数据——转化为可用于 SFT、偏好与可验证奖励训练的高质量数据并回流模型团队。
- 模型评测建设:对可对照公共数据库或计算判定的任务优先建成自动化 verifiable eval;构建端到端 Agentic 科学评测——涵盖科学工具调用与编排、多轮交互、长程规划、异常恢复、结果可复现性与科研安全边界(含双重用途/生物安全判断),推动任务从「单点问答」向「复杂真实科研场景」演进。
- 质量管控与质检:建立双标注一致性校验、资深专家抽检、难度标定校准、查重去污与一致性审核机制;对 bad case 做根因分析(数据 / rubric / verifier / 实例),并将结论回流数据生产与评测标准,保证结果可信、可复现、可追溯。
- 数据基础设施共建:与工程团队共建支撑大规模科学标注与自动化评测的基础设施(沙箱 / 容器化科研环境、数据管线、评测框架),推进大规模生物数据(序列、结构、基因组、单细胞)的采集、编排与 AI-agent 接口建设。
- 行业跟踪与跨团队协同:持续关注 AI for Science 与科学智能体方向动态;将评测洞察转化为模型改进方向(知识准确性、推理可靠性、长程任务成功率、科研安全),并与研究、工程及实验团队协作落地。
任职要求
- 化学、药物化学、化学信息学、生物、计算生物、生物信息学或相关定量学科博士(或具备同等深度的研究经历),对生命科学/化学领域大模型的能力边界有深入判断,能将真实科研任务转化为可标注、可评测的数据;跨学科(化学 + 生物 + 计算)背景优先。
- 具备扎实的科研实践经验,理解科学研究与实验流程中的关键失效点,能将模糊的科学问题抽象为结构化评测维度与可验证结论,并把领域经验转成数据集 / benchmark / 失败案例。
- 熟练掌握 Python,具备科学编程、数据处理、统计分析与可视化能力;了解主流大模型推理服务及科学工具链——如 RDKit、pandas、Biopython、结构生物学或基因组学分析工具、公共数据库与 notebook 环境;具备大规模生物/化学数据处理与数据管线经验。
- 了解 Agent 核心机制(ReAct、Tool Use、Planning、多步推理与反思)与后训练范式(SFT / RLHF / 可验证奖励 RL、RLVR),对科学类 Agent 的能力边界(知识幻觉、推理误差累积、长程任务失败模式、实验可复现性与科研/生物安全风险)有认知或实践。
- 有以下经验者优先:药物化学与小分子设计优化(SAR、hit-to-lead)、湿实验合成与 CRO 外包管理、科学数据集 / benchmark 构建、大规模生物数据(序列、结构、基因组、单细胞)处理、蛋白质语言模型或生物序列模型、LLM 后训练、科学智能体或 AI for Science 平台研发、Docker/K8s 云部署,以及论文 / 专利 / 开源成果。
- 优秀的技术写作与沟通能力,能向研究与工程团队清晰传达评测思路,产出高质量的标注规范、评测方案与分析报告;具备强烈的科研好奇心、独立推进模糊问题的能力与跨职能协作意识。
岗位标签
NEW