jdwatch
  • Home
  • CLI
  • Skills
  • Blog
  • FAQ
  • Pricing
Sign In
Sign Up
jdwatch

Job aggregation tool from multiple recruitment sources.

© Copyright 2026 JDWatch. All Rights Reserved.

Get Started
  • Sign In
  • Sign Up
Legal
  • Terms of Service
  • Privacy Policy
  • Refund Policy
  • Cookie Policy
Contact
  • service@jdwatch.work

蚂蚁集团-财富AI Lab-大模型评测工程师(金融方向)

Company Antgroup

Focus Tech · Algorithm

Location 北京, 杭州

Published August 25, 2026

岗位职责

  1. 建设金融领域深度 Benchmark:抽象投资理财领域的真实任务,把金融专家的研究框架、分析逻辑与业务规则沉淀为可泛化、可规模化的 Rubric / Checkpoint;从真实流量、典型任务、长尾与高风险 Case 构造有代表性的金融评测集,持续提升蚂小财的金融专业力与事实准确性;
  2. 设计金融专业评测标准与多路 Judge:联合金融专家、产品、算法团队,将专业判断转化为原子、可追溯的标准;组合 LLM Judge、金融事实核验、规则 / Python Judge、Vision 与 Trace Judge,并结合专家 Gold 持续校准,提升评测可信度;
  3. 开展版本评测与根因归因:搭建生产级评测工程,通过同口径 A/B、配对实验、置信区间与噪声基线判断版本变化是否真实,链路定位问题,区分模型错误、金融口径差异、检索供给错误、工具故障与 Judge 误判;
  4. 推动质量改进闭环:将评测发现转化为模型、数据、Prompt、工具、产品或标准的明确改进动作,建立Badcase 闭环,联动算法、产品、工程与金融专家团队,输出支持版本准出与研发决策的指标、证据与代表性 Case。

任职要求

  1. 金融相关专业背景:计算机/数学/统计 + 金融交叉背景优先,金融工程、金融学、数量经济等相关专业;有基金、券商、银行理财、投研、量化或保险资管等金融机构从业经历者优先;3年以上工作经验,本科及以上;
  2. 投资理财专业能力: ① 领域知识——熟悉股票、基金、ETF、债券、衍生品、资产配置等至少一个方向,能核验并挑战其中的金融逻辑与结论; ② 数据严谨性——理解金融数据的主体、口径、币种、复权、报告期等维度,能识别主体错配、时点错配、单位错误与口径混用,能从推导过程、适用条件、风险边界追问结论的可靠性; ③ 合规边界——理解收益承诺、投资建议、投顾适当性等金融合规红线;
  3. AI 动手经验:拥抱 AI,有用大模型做过投资理财类 Agent、量化分析、投研辅助等场景任务的动手经验,熟悉 Prompt、RAG、Agent 与工具调用机制;
  4. 评测与方法论:对评测与实验设计有兴趣,愿意在团队方法论下掌握抽样、对照实验、Precision/Recall、置信区间、偏差等概念;具备结构化分析与证据意识,能在结论存在争议时明确事实、假设与边界;
  5. 加分项:建设过 LLM Benchmark、LLM-as-a-Judge、RAG / Agent Evaluation 或自动化评测平台;有 CFA、FRM、CPA、证券/基金从业等知识体系;有论文、专利、开源项目或用 AI 解决过金融行业问题的可展示案例。

特色标签

A/B实验、AI代理、LLM、Prompt模板、Python、Retrieval-Augmented Generation、Shell、SQL、交易型开放式指数基金、保险、信贷、分组测试、合规、基准数据集、基准测试、大数据处理工具(Spark/Hadoop/Hive)、大模型算法、大语言模型、对照实验、打分模型、指数基金、提示词、提示语、支付、数据安全、数据挖掘、智能体、机器学习、检索增强生成、深度学习、理财、知识图谱、自主代理、自然语言处理算法、证券投资、评估器、评测器、评测基准、资产配置、金融、金融口径、金融指标、金融数据集、银行、风控