研究型实习生-面向大模型编程的应用级高质量代码数据合成策略研究和落地
Company Antgroup
Focus Tech · Algorithm
Location 杭州
Published July 13, 2026
岗位职责
研究领域: 人工智能 项目简介: 过去两年,以大语言模型为核心的“超级助理”迅速普及。豆包、Kimi、ChatGPT 等产品将信息检索、知识问答与日常服务压缩成一句对话,显著降低了普通用户的获取门槛。然而,这些助理的输出仍以“文字 + 静态图片”为主,面对“太阳系如何形成”“能否给我一段可弹奏的钢琴谱”等需要动态演示或交互的提问时,图文组合便显得力不从心。与此同时,大模型的代码能力突飞猛进。随着 Claude 3、DeepSeek 等新一代模型的发布,用自然语言直接生成可运行程序已成为现实。SVG / Canvas 动画、可交互小应用等原本需要专业前端工程师数小时才能完成的内容,如今只需一句提示即可雏形初现。这为“超级助理”从“说给你听”升级为“做给你看”提供了技术可能。但通用大模型离生产级应用仍有距离,具体来说分为2个点。 1:端到端可用率低——生成十段代码,往往只有一两段可直接运行; 2:渲染精度不足——比例、颜色、动画节奏与用户预期存在偏差; 这些问题的根源在数据。现有训练语料中的可视化代码多为“片段化、噪声高、缺乏上下文”的开源示例,不足以支撑高可靠、低延迟的落地需求。因此,本课题拟从“应用级可视化代码数据”切入,建立一条覆盖数据清洗、质量评估、自动合成与人工精标的完整链路,最终构建 20 万条可直接用于微调的高质量 SVG / Canvas 程序样本,为下一代“能画、能动、能交互”的超级助理奠定数据基石
任职要求
研究领域: -目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位 -具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go -具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究 优先录用: -对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色 -在国际会议上或核心期刊发表一份或多份出版物或论文 -至少3个月的全职工作
特色标签
AI助手、C/C++、Golang、Java、Python、交互式可视化、代码生成、前端可视化脚本、参数微调、发表算法相关优秀论文、可执行代码、合成数据生成、图形化程序、大模型算法、大语言模型、数据去噪、数据预处理、智能代理、模型精调、清洗后代码数据、生成式AI、矢量图形动画、程序生成、自动化数据构造、自然语言处理算法、运行时程序、高保真代码样本