数据基础及产品-数据处理工程师-搜索引擎方向Company AlibabaFocus Tech · BackendLocation 杭州Published August 28, 2026岗位职责 建设基于 LLM/VLM 的网页解析系统,完成正文识别、语义分块、内容去噪及关键字段的结构化抽取。 建设 Agent 化解析能力,根据页面类型和任务目标自主选择解析策略、调用工具、验证结果并进行错误修正。 解决复杂网页、长页面、图文混排和多语言页面中的解析准确率、覆盖率、成本及稳定性问题。 建设网页内容和页面形态分类体系,识别新闻、商品、论坛、问答等内容类型,以及首页、列表页、详情页、聚合页等页面形态。 综合页面内容、DOM结构、URL、链接关系和视觉信息,提升分类模型对长尾页面及新类型页面的泛化能力。 将分类结果应用于抓取调度、解析策略、索引构建及搜索召回排序。 建设网页完整度、原创度、时效性、可信度和内容价值评估能力。 识别低质内容、重复内容、SEO垃圾页、内容农场、镜像站及恶意跳转等问题。 建设网页解析、分类和质量评估体系,持续提升网页数据质量及搜索效果。 任职要求 计算机、人工智能、数学或相关专业,本科及以上学历。 熟练掌握 Python,熟悉 Java、Go 或 C++ 中至少一种语言。 具备搜索引擎、网页解析、网页分类、信息抽取或内容质量相关经验。 熟悉 HTML、DOM、URL、页面链接关系及常见网页结构。 熟悉文本分类、多标签分类、实体识别、语义匹配、聚类或异常检测等技术。 熟悉 LLM 的 Prompt Engineering、结构化输出、Function Calling、Tool Use 和上下文管理。 具备 LLM 信息抽取、VLM 页面理解、RAG 或 Agent 相关项目经验。 能够设计包含任务规划、工具调用、结果验证和异常降级的 Agent 工作流。 具备良好的工程化及评测能力,能够综合考虑准确率、覆盖率、延迟、成本和系统稳定性。 加分项 有搜索引擎网页处理、索引数据生产或搜索质量优化经验。 有基于 LLM/VLM 进行网页或文档结构化解析的生产实践。 有 Agentic Parsing、Browser Agent 或 Deep Research Agent 相关经验。 有模型微调、蒸馏、数据合成或小模型部署经验。 熟悉 OCR、网页截图理解及多模态页面解析。 熟悉 Playwright、Puppeteer、Chromium/CDP 等动态网页渲染技术。 熟悉 HTTP、代理、分布式爬虫、URL调度及大规模网页采集系统。 熟悉 Elasticsearch、Kafka、Redis、Spark、Flink 或向量数据库。 岗位标签 NEW