岗位职责
团队介绍:国际化内容安全平台团队致力于为字节跳动国际化产品的用户维护安全可信赖环境,通过开发、迭代机器学习模型和信息系统以更早、更快发掘风险、监控风险、响应紧急事件,以人工智能技术支持业务发展,力求更高效、更敏捷、更全能地维护站内生态安全。
- 极限推理性能优化:针对千亿级超大模型与复杂的视觉语言模型(VLM),在真实高并发海量流量下进行推理框架的深度定制与优化,突破系统内存与计算瓶颈,实现业界领先的吞吐量与超低延迟;
- 前沿模型架构的底层适配与调优:面向业界前沿的新型模型结构(如MoE、Sparse Attention、Linear Attention、新型Vision Encoder等),进行深度的算子级(Kernel)开发与软硬协同调优,压榨硬件极限算力;
- “推理友好型”模型架构设计:跨越算法与系统的边界,从推理加速的视角参与模型架构的设计与迭代;包括:Linear Attention,模型量化、KV Cache压缩、知识蒸馏等技术在线上业务的规模化落地;
- 前沿课题探索:围绕投机解码(Speculative Decoding)、新型多模态融合架构、长文本上下文加速、分布式推理策略等方向开展前沿研究,并在真实业务场景验证,支持AI顶会论文发表。
任职要求
- 2027届获得本科及以上学历,计算机、软件工程、数学、物理学等相关专业优先;
- 熟练掌握C++、Go、Python或Shell等1-2种编程语言,并能在Linux环境下工作;
- 理解分布式系统原理,具备大规模机器学习系统的设计、开发与维护经验;熟悉Kubernetes架构,拥有系统级开发与性能调优经验;
- 熟悉主流深度学习框架(如PyTorch、DeepSpeed、Megatroin、vLLM等),有大规模数据处理与并行计算经验,对前沿LLM研究与工程(如长上下文、多模态、对齐研究、智能体生态系统等)有深入理解与实践经验者优先;
- 有深入CUDA编程与性能调优(CUTLASS、Triton)经验者优先;
- 具备机器学习模型评估、LLM应用与智能体开发经验者优先。