岗位职责
团队介绍:视频与边缘部门承载了字节跳动的媒体内容分发基建及技术中台,支持了字节跳动全系产品,如抖音、今日头条、番茄小说、西瓜视频等APP的点播、直播、实时通信、图片等多媒体业务发展,同时将业务发展过程中沉淀下来的技术能力和工具,通过火山引擎对外输出,面向各行各业用户提供视频云产品和服务,愿景是为内外部业务伙伴提供最低成本、最优画质、最低延时、最安全可靠的富媒体内容分发解决方案,助力业务伙伴降本提效实现持续增长。
- 负责音频表征核心技术研发,聚焦语音、音乐和环境音等多场景音频的特征提取、表示学习与优化,构建高效、鲁棒的音频表征体系;
- 负责前沿技术调研与落地,跟踪深度学习、自监督学习和对比学习等领域在音频表征方向的最新进展(如Wav2Vec、HuBERT、AudioMAE等模型),并结合业务场景进行创新应用;
- 搭建音频表征模型的训练、评估与部署Pipeline,优化模型性能(精度、效率、泛化能力),满足量产级产品的工程化要求;
- 与算法工程、产品和业务等团队紧密协作,推动技术方案落地与迭代,输出技术文档与专利成果。
任职要求
- 2027届获得硕士及以上学位,计算机科学、电子工程、信号处理、人工智能、声学等相关专业优先;
- 具备扎实的音频信号处理基础,深入理解傅里叶变换、梅尔频谱、MFCC、谱减法等传统音频特征提取方法,同时精通深度学习在音频领域的应用;
- 熟练掌握至少一种深度学习框架(PyTorch/TensorFlow),具备丰富的音频表征模型(自监督、半监督、有监督)设计、训练与调优经验;
- 具备良好的编程能力,熟练使用Python/C++,能够独立完成算法原型开发、实验验证与工程化适配;
- 具备较强的问题分析与解决能力,对技术有追求,具备良好的沟通协作与跨团队推动能力。