WebCleaner新王:Pulpie以1/20成本追平SOTA,单GPU每秒处理13.7页

网页清洗(Web Cleaning)是数据管线上最繁琐也最容易被忽视的环节。从爬虫获取的HTML中剥离导航栏、广告、页脚等模板噪声,保留正文内容,直接决定下游NLP模型(如RAG、训练语料、知识图谱)的输入质量。传统方案依赖正则表达式或解析器(如Readability、Boilerpipe),召回率不稳定;近年基于Transformer的模型(如Dripper)虽精度高,但部署成本高昂——600M参数的模型在单张NVIDIA L4 GPU上每秒仅能处理0.68页,清理解析10亿页HTML需花费约15.9万美元,这对于追求性价比的数据团队而言接近不可承受。

Pulpie 的突破来自两个维度:模型架构优化与推理效率革命。 该模型族采用纯编码器架构,不依赖解码器或序列生成,而是通过单次前向传播直接预测每个HTML块属于“内容”还是“模板”。这种设计使模型天然适合并行批处理。最小模型 Pulpie-Orange-Small 仅210M参数,在 WebMainBench 基准上取得 ROUGE-5 F1 分数 0.862,仅比600M参数的 Dripper(0.864)低0.002。而推理速度达到 13.7 页/秒,是 Dripper 的 20 倍。换算成成本:处理10亿页HTML,Pulpie 的硬件成本约为 7,900 美元(按L4 GPU云实例费率计算),Dripper 则需 159,000 美元。这意味着,企业可以用此前1/20的预算获得几乎相同的提取精度。

Pulpie 并非单一模型,而是一族 Pareto 最优 的模型集合,用户可根据吞吐/精度偏好选择不同大小的版本。全部模型已开源在 HuggingFace 上,附带一键推理脚本和 ONNX 导出支持,可直接接入现有数据管线。对于正在搭建大规模爬虫或语料清洗流程的团队,替换成本仅为一次适配:修改数据管道中的HTML清洗组件,输入输出格式与现有工具(如 trafilatura、goose3)兼容。

实用建议:如果你的管道每天处理百万级以上的网页,且对内容提取精度敏感(如训练LLM、构建大规模知识库),直接迁移到 Pulpie 是当前回报率最高的优化之一。其最小模型在消费级GPU上即可跑出接近 SOTA 的质量,而计算资源的节省可以重新分配给其他预处理环节(如去重、语言识别)。对于追求极致精度的场景,还可选择更大的 Pulpie 变体,但即便最大模型的推理成本也远低于 Dripper。趋势判断:随着网页交互复杂度(JS渲染、动态加载)加深,基于静态HTML的清洗方法面临天花板,但 Pulpie 的设计证明了“更精细的编码器+单次推理”范式仍有巨大优化空间,未来此类工具将继续朝更小、更快、更专的方向进化。