浏览器数据后处理算法工程师
Company Tencent
Focus Tech · Algorithm
Location 北京
Published September 18, 2026
岗位职责
- 针对浏览器端/云端协同交付场景,开发并优化包括网页长文本/复杂结构清洗、核心正文解析抽取、智能切片与摘要生成、元数据提取等关键能力,提升端到端处理质量与时延表现;
- 深入探索小模型(1B~7B)的技术上限,在 Efficient Fine-Tuning、SFT、DPO/RLHF 对齐、模型量化压缩及长文本上下文扩展等方向持续迭代,探索端侧/低算力部署的最优解;
- 联合数据团队搭建高质量后处理语料库构建流程,通过 Synthesizing Data(合成数据)与 Reward Model 精选数据集,持续提升模型在复杂变体网页上的泛化能力。
任职要求
- 专业背景: 计算机、人工智能、软件工程或数学相关专业,本科及以上学历,3 年以上 NLP / LLM 算法开发经验;
- 小模型后训练经验: 深入理解大/小语言模型架构,具备丰富的小模型(如 Llama, Qwen, Phi, Gemma 等系列)全流程 Post-training(预训练增量/SFT/DPO/PPO)实战经验,熟悉高效微调(LoRA, QLoRA)与分布式并行训练框架(DeepSpeed, Megatron-LM, Ray 等);
- 数据处理能力: 具备大规模海量数据(PB级/数十亿网页级)清洗与构建经验,熟悉网页解析(HTML/DOM Tree 提取、格式转换)及文本去重、过滤、质量评分机制;
- 探索与工程落地: 具备优秀的技术敏锐度和独立探索能力,能快速跟踪并重现业界最新顶级论文或开源方案;具备良好的 Python/C++ 编码能力,熟悉 PyTorch 生态,能兼顾效果与推理吞吐/延迟性能。
产品/项目
大混元
工作年限
三年以上工作经验