岗位职责
- 评测体系设计与搭建: 负责设计和搭建业界领先的全模态(图文、音视频)大模型评测体系,建立科学、全面、高效的评测流程、标准和自动化平台。
- 评测基准 (Benchmark) 建设: 主导全模态评测基准的建设,持续追踪和引入学界、业界最新成果,并结合业务场景,设计和构建能反映模型真实能力的评测数据集。
- 核心能力度量: 深入研究全模态大模型的能力边界,设计创新性的评测方法和指标(Metrics),精准度量模型在跨模态理解、内容生成、多轮交互、逻辑推理、鲁棒性及安全性等维度的综合能力。
- 技术落地与效率提升: 发挥强大的工程和动手能力,主导评测工具链和平台的开发与优化,实现评测流程的自动化和规模化,大幅提升评测效率和质量。
- 跨团队协作: 与算法、工程、产品团队紧密合作,将评测结果有效转化为模型能力提升和用户体验优化的具体行动,共同打造顶尖的全模态AI产品。
任职要求
- 学历背景: 计算机科学、人工智能、电子工程或相关领域的硕士及以上学历。
- 专业经验: 3年以上在多模态学习、自然语言处理(NLP)、计算机视觉(CV)处理领域的算法研究和工程开发经验。
- 工程能力: 具备出色的编程能力,精通 Python,并熟练掌握至少一种深度学习框架(如 PyTorch, TensorFlow);具备很强的动手能力,能够独立完成评测系统的设计和开发。
- 评测专长: 对大模型(特别是多模态大模型)的评测有深入的理解和丰富的实践经验,熟悉主流的图文、视频、语音评测基准和方法(如 MMBench, MMMU, V-Bench, SEED-Bench, Audio-Eval 等)。
- 研究与分析能力: 具备优秀的分析和解决问题能力,能够独立设计实验、分析评测数据并形成有价值的结论和洞察。
- 沟通与协作: 具备良好的团队合作精神和沟通能力,能够跨团队高效协作,推动复杂项目落地。
特色标签
Benchmark建设、CV、NLP、Python、图像算法、图像识别、多模态AI模型、多模态处理、多模态学习、多模态智能模型、多模态算法、大模型算法、大规模模型、大语言模型、模型训练框架、模型评估、测评、测评体系、测评基准、测评平台、深度学习框架、算法工程化经验、自然语言处理算法、评估、评估体系、评估工具链、评测体系、语言模型处理、语音算法、金融