当全球科技界为AI大模型训练语料的版权问题争论不休时,一段70年前的往事提供了另一种解题思路。1956年1月24日,全球最大私营公司AT&T在与美国司法部的反垄断和解中签署专利法令,将当时名下7,820项未过期专利免费授予所有美国企业,并承诺未来新专利按“合理费率”授权。作为交换,AT&T保留了Western Electric(其制造部门),但被永久禁止进入电信以外的商业领域。
这项在当时看似严厉的制裁,却意外催生了现代信息产业的摇篮。贝尔实验室69%的非电信专利——涵盖化学、半导体、光学等当时最前沿领域——迅速流入市场。据估算,短短几年内,这些专利产生了约35亿美元的衍生价值(以1950年代币值计算,相当于今天的数百亿美元),并直接孵化了肖克利半导体实验室、仙童半导体公司和英特尔。集成电路的共同发明人戈登·摩尔曾评价,该法令是“商业半导体行业最重要的进展之一”。
这段历史的价值在于揭示了科技创新的公共品属性与私人商业利益之间的制度性平衡。如今,类似的结构性矛盾体现在大模型的语料训练上:一方面,互联网上大量高质量文本、图片和视频数据由无数个体用户、内容创作者和小型组织提供,它们构成了AI训练的基础。另一方面,少数科技巨头凭借其资本和技术优势,将这些公共数据“私有化”为商业模型的核心资产,既未支付合理报酬,也未形成反哺制度。
当前语料治理的核心矛盾在于:对数据采集缺乏类似“专利池”的共享机制,导致权利归属不清和交易成本过高。贝尔实验室的案例提供了一种可能路径——如果司法或立法能够推动建立某种“语料集体管理组织”,类似音著协之于音乐版权,或专利池之于技术标准,能否既保护内容创作者权益,又避免垄断性收费抑制技术进步?
有专家提出,可以建立一种“语料版税”机制:AI公司在训练模型时,根据使用语料的类型和数量向集体管理中心缴纳费用,该费用按贡献方(平台、内容创作者、原始权利人等)进行分配。这种设计并非包治百病的完美方案,但至少提供了一种集体博弈的框架,防止公共领域的数字资产被少数巨头无偿捕获。
从贝尔实验室到今天的AI语料,历史一再证明:当公共创新资源被合理释放并建立公平分配机制时,整个行业的繁荣将远超任何单一企业的封闭策略。对那些关心自己留在网络上的每一条评论、每一张图片最终流向何处的用户而言,推动建立类似的“语料公共池”或许是最务实也最长远的选择。