大模型数据引擎工程师InternCompany KuaishouFocus Tech · AlgorithmLocation 北京Published August 12, 2026岗位职责 参与打造生成式大模型的数据基础设施,构建高性能、分布式、可扩展的数据系统,通过数据驱动模型生产,让海量数据场景下的算法迭代又快又稳; 参与构建 agentic 数据生产体系:将数据基建能力封装为 agent 可靠调用的工具与服务,参与研发数据链路的编排与运行框架——让数据管线的搭建、运维、排障逐步由 agent 自主完成; 在导师带领下攻坚以下领域之一的核心架构难题:大规模分布式计算与调度 / 海量多模态存储 / 跨模态检索 / 大规模批量推理优化等; 参与建设数据管线的无人值守能力与全链路可追溯:作业级容错与自愈、自动化质量监测、数据版本化与血缘、数据实验归因体系; 与算法、数据交付团队紧密协作,共同定义算子与数据服务的接口标准,以 Co-Design 方式共同提升模型效果。 任职要求 计算机及相关专业本科及以上学历; 扎实掌握至少一种系统语言(C++/Go/Rust/Java)及 Python,有课程项目或实习中的系统开发实践,对吞吐/延迟/资源成本有基本体感; 对以下某一方向有浓厚兴趣和扎实基础,愿意深入钻研(方向说明见下方); 具备抽象思维:能把复杂问题拆解为清晰的模块与接口,有意识地追求"好用、可复用、可观测"的设计; 善用 AI-coding 与大模型工具,认同 agentic 研发理念; 沟通务实,乐于跨团队协作,尊重相邻方向的专业判断。 方向长板(以下四选一,至少一个方向达到深入理解水平): 分布式计算与调度:深入理解 Ray/Spark/Flink 之一的架构与调度机制,有课程实验或实习中的大规模数据处理实践;了解 Kubernetes 批调度、GPU 调度者优先; 存储与数据湖:理解对象存储/数据湖/分布式缓存的核心设计,有海量数据读写的实践或课程项目经验;了解数据版本化或血缘系统者优先; 检索与索引:理解向量检索引擎(Faiss/Milvus 等)或倒排/多维索引的原理,有 ANN 建库或检索调优的实践;了解跨模态检索(文搜视频/以图搜视频)者优先; 推理优化:理解 vLLM/SGLang/TensorRT 类推理框架的核心机制,对动态 batching、量化加速、显存与吞吐调优有实践认知;了解视觉/多模态模型推理优化者优先。 加分项(各方向通用): 有多模态/视频数据处理相关经验(视频编解码、GPU 视频处理管线、BMF/Ray Data 类框架); 参与过知名开源项目,或有高水平论文(CVPR/ICCV/ECCV/NeurIPS/ICML 等); 有ACM/ICPC、Kaggle 等竞赛获奖经历; 有相关方向的大厂实习经历。