岗位职责
团队介绍:国际化内容安全平台团队致力于为字节跳动国际化产品的用户维护安全可信赖环境,通过开发、迭代机器学习模型和信息系统以更早、更快发掘风险、监控风险、响应紧急事件,以人工智能技术支持业务发展,力求更高效、更敏捷、更全能地维护站内生态安全。
日常实习:面向全体在校生,为符合岗位要求的同学提供为期3个月及以上的项目实践机会。
- 参与大语言模型相关算法和应用系统的研发,包括但不限于文本理解、分类、信息抽取、摘要生成、内容匹配、智能问答和复杂信息分析等方向;
- 参与大模型训练、监督微调、偏好优化、Prompt-Engineering和模型效果优化,探索不同模型和训练方法在实际业务场景中的应用;
- 参与RAG(检索增强生成)系统建设,包括数据处理、知识库构建、Embedding、召回、排序、上下文组织和答案生成等模块;
- 参与基于大模型的Agent系统研发,探索任务规划、工具调用、工作流编排、多智能体协作、记忆机制和结果验证等技术;
- 参与大模型应用的数据飞轮建设及评测体系建设,涵盖训练数据构造、自动化标注、难例挖掘、用户反馈利用、模型持续迭代,以及从准确性、召回率、相关性、稳定性、时延和成本等维度评估优化系统效果;
- 跟进并复现大模型、RAG、Agent、信息检索等领域的前沿论文和技术方案,并推动其在实际业务中的落地。
任职要求
- 本科及以上学历在读,计算机、人工智能、软件工程、数学、统计学等相关专业优先;
- 具备扎实的计算机和算法基础,熟悉数据结构、机器学习、深度学习或自然语言处理中的至少一个方向;
- 熟练掌握Python,具备良好的编码能力和工程实践习惯;熟悉PyTorch、Transformers等框架者优先;
- 理解Transformer、BERT、GPT等模型的基本原理,对大语言模型训练、推理或应用开发有一定了解;
- 对以下任一方向有实践经验者优先:
1)大模型预训练、监督微调、LoRA、偏好优化或强化学习;
2)RAG、Embedding、向量数据库、搜索召回或排序算法;
3)Agent、工具调用、工作流编排或多智能体系统;
4)Prompt Engineering、大模型应用开发或模型服务部署;
5)自然语言处理、文本分类、信息抽取、摘要、聚类或语义匹配;
- 具备较强的学习能力、问题分析能力和主动性,能够快速理解业务问题,并将算法方案落地为可运行的系统;对大模型技术保持热情,愿意持续跟进前沿研究,并关注技术在真实场景中的实际效果。