大模型数据采集工程师
Company 哔哩哔哩
Focus 技术 · 算法
上海
May 22, 2026
岗位详情
工作职责: 岗位职责:
- 负责面向视频生成模型的海量多模态数据采集,搭建高吞吐、高可用的分布式爬虫系统,覆盖主流短视频平台、影视网站及公开视频库。
- 构建视频数据清洗与预处理流水线,利用多模态大模型(VLM)或传统CV算法,对爬取的视频进行去重、画质评估、敏感内容过滤及基础结构化标注。
- 负责爬虫系统的合规性建设,严格遵守《数据安全法》、《个人信息保护法》及Robots协议,设计数据脱敏与隐私保护方案,规避法律与业务风险。
- 持续优化数据采集链路的工程化能力,包括代理IP池管理、容器化部署(Docker/K8s)、任务调度监控及异常自动重试机制,保障数据供给的时效性与稳定性。 工作要求: 任职要求:
- 计算机、大数据、人工智能等相关专业本科及以上学历,具备扎实的Python/Go编程功底,精通Scrapy、Playwright、Selenium等主流爬虫框架。
- 深入理解HTTP/HTTPS、WebSocket等网络协议,熟悉FFmpeg等音视频处理工具,有大规模视频/图片等多模态数据采集与存储(MySQL/MongoDB/OSS)实战经验。
- 具备极强的反爬对抗能力,熟悉国内外主流站点的反爬机制(如验证码、指纹识别、JS逆向、App抓包),并有成熟的破解与绕过方案。
- 熟悉Linux开发环境及Docker容器化技术,了解分布式任务调度(如Airflow、Celery),能够独立搭建和维护高并发的数据采集集群。
- 具备良好的数据合规意识,了解网络爬虫相关的法律边界,能够在保证数据安全的前提下高效完成采集任务。 加分项:
- 有视频生成(Text-to-Video)、多模态大模型(VLM)数据工程或AI数据中台开发经验者优先。
- 熟悉大模型数据清洗标准,了解如何使用Prompt工程结合VLM进行自动化视频质量打分与筛选。
- 有处理Trillion级别以上