- 美股资讯
AI公司为什么突然疯狂买旧书?背后是一场没人注意的数据危机!
AI

我们可能低估了这场AI战争的残酷程度。
AI公司正在批量购买旧书、绝版书和外语书,用液压机切掉书脊,再高速扫描成训练数据。不是为了文化保护,而是因为互联网上高质量的人类文字快被用遍了,网络又被大量AI生成内容污染。
2022年之前出版的书,特别珍贵,因为那时候还没有ChatGPT去帮忙写稿
法院文件显示,Anthropic早在2024年就启动“Project Panama”,购买并拆解数百万本纸质书。
$META等巨头也因训练数据问题卷入版权诉讼。AI现在缺的不只是$NVDA 的算力和
$MU 的内存,还缺没有被AI加工过的“真人数据”。
但这不代表$NYT、$NWSA 等传统媒体一定会暴富。旧书和历史新闻属于一次性存量,模型买一次、扫一次,就可能长期使用;版权诉讼虽然能提高内容价格,却未必能带来持续高增长。
真正更值钱的,是不断更新、无法一次买断的数据:$RDDT 每天产生真实的人类讨论,$TRI掌握法律和税务数据,$SPGI 、$FDS 掌握金融与评级数据。AI越深入专业行业,就越离不开这些高频、准确、可追溯的数据。
美股投资网分析认为,AI数据荒真正的投资逻辑不是“有内容就值钱”,而是谁拥有机器无法免费复制、每天都在更新的人类信息。
旧书是一次性燃料,专业活数据才可能成为长期收费的水电煤



