岗位职责
- 你是蚂蚁数据背后的研发人, 能够参与蚂蚁大数据的采集、存储、处理,通过分布式大数据平台加工数据,支持业务管理决策;
- 能够构建面向大模型的高质量企业信用数据资产体系,通过多源异构数据的清洗、融合、向量化和结构化,挖掘可被AI理解和推理的通用知识,打造AI-Native数据处理链路从原始日志等数据到模型可消费数据的端到端闭环,驱动内部智能决策和外部商业化场景;
- 能够参与蚂蚁大数据体系的模型设计、开发、维护,通过元数据、质量体系有效的管理和组织EB级的数据;
- 能够接触世界领先的大数据处理与应用、大模型基础设施的技术和平台,获得大数据浪潮之巅的各类大牛的指导。
任职要求
必须具备的:
- 所学专业是计算机、数学、统计、数据科学与大数据技术等相关专业;
- 有强的动手能力和学习能力,熟练掌握一门数据处理语言,如Python、SQL、JAVA、Perl等,熟悉unix或者linux操作;
- 会用AI、善用AI,了解在数据处理中大模型的使用、评估、优化方法;
- 理解大模型的应用与优化,熟悉Transformer模型结构、注意力机制、位置编码等基础架构,能结合业务场景设计高效Prompt或微调方案,熟悉Agent工作流;
- 具备扎实的专业基础,良好的沟通能力和团队合作,主动积极,乐于面对挑战。
有一定了解的:
- 了解常用的数据建模、知识建模理论、方法。
可以加分的:
- 有参与过大模型相关数据项目,如训练数据准备、知识构建、向量索引、核心数据挖掘等相关项目;
- 对Hadoop、Hive、Spark、Flink、Ray、Hbase等分布式平台有一定的理解;
- 在Github等开源社区具备有较大影响力的技术项目,作为Collaborator/Committer/Member优先;
- 作为重要角色参与领域内有含金量的比赛并取得成绩(比如ACM);
- 发表顶刊顶会(参考CCF-A),担当一作/并列/二作;● 获得过大模型数据处理、向量检索、Agent知识系统等相关的专利。
特色标签
AI决策、EB级数据、Flink、Flink流处理、Hadoop生态、Hbase、Hive、Java、LLM、PB级数据、Prompt微调、Python、Shell、Spark、Spark集群、SQL、云原生、云计算、保险、信贷、全链路闭环、分布式系统开发经验、分布式计算、区块链、参加算法相关竞赛/获奖、反洗钱、发表算法相关优秀论文、合规、向量搜索、向量数据库、向量检索、商业化、多元数据、多源数据集成、大数据、大数据处理工具(Spark/Hadoop/Hive)、大数据开发经验、大模型算法、大规模预训练模型、大语言模型、异构数据融合、微调方案、推荐、搜索、支付、数据处理经验、数据安全、数据库、数据挖掘、数据治理、数据质量、数据闭环、数据预处理、数据驱动决策、智能交互、智能体、智能分析、有留学背景、机器学习建模经验、模型加速/性能优化、模型微调、海量数据、熟悉Linux环境、理财、知识图谱、知识抽取、知识表示、算法工程化经验、自动化流水线、自然语言处理算法、英美留学生、计算机相关专业、跨境、金融、银行、隐私计算、风控