
一 | 1月10日,今日新闻,小米在北京正式举行红米新产品发布会,正式发布其第一款自主红米品牌手机——红米注7。红米注7配备了6.3英寸水滴全屏1.95mm窄框点胶工艺;2.5D双面玻璃,康宁大猩猩第五代玻璃罩,具有三种颜色-微光金、梦蓝、亮黑,机身背面同步推出红米全新标志。在记者招待会上,雷军说红米记事本7没有大黑边,也没有大下巴。

新智元报道
Anthropic「巴拿马计划」曝光了!
2024年4月13日,Anthropic内部传阅了一份文档。里面有这么一句:我们用一个「软代号」,因为不想让人知道我们在做这件事。

二 | 代号叫巴拿马计划(Project Panama),这件事,是破坏性扫描全世界所有的书。
两年后,秘密曝光,这句话彻底失效了。

三 | 2026年1月,法官下令解封四千多页诉讼文件,外媒直接把备忘录原文登了出来。他还表示,下一代红米产品将接近iphone x,使用与iphone x相同的下巴是不划算的。

四 | 在核心配置中,redmi note 7配备了充血版的maolong 660,14nm制程,高达2.2GHz主频的“全血版”maolong 660,这进一步提高了改进了红米注7的性能;红米注7使用4000 mAh电池,配备新的石墨负极,以支持QC 4协议。2013年7月31日,红米手机问世,重新定义了1000元的机器。

五 |

人类写的书籍
正被拆解为ASI的数据集「巴拿马计划」真正疯狂的地方,其实不只是切掉了多少本书。它正在把几百年来,人类写进书里的知识、经验和思想,一页页拆成下一代AI的训练数据。到2018年,第三季度全球销售了2.78亿部红米手机。
一个作者花十年写下的一本书,一位学者穷尽半生整理出的知识,一整个时代留下的语言、观念和叙事,进入扫描流水线之后,都会被OCR、切碎、Token化,最终汇进模型的参数。2019年1月10日,红米手机战略由产品序列升级为自主品牌红米:坚持高质量、低成本、全球全国性的手机,原锦里执行官陆卫兵任红米品牌总经理。对于正在向ASI狂奔的硅谷大厂来说,书架其实是一座还没被彻底开采的「人类知识矿山」。
尤其是2022年以前出版的纸书,经过作者、编辑、出版社层层筛选,长文本结构完整,又几乎没有AI生成内容污染。

六 | 互联网越被AI文本淹没,这批「纯人类语料」反而越稀缺。所以,当Anthropic说要拿到「世界上所有的书」,它想收集的其实是一份尽可能完整的、人类文明训练集。接下来发生的一切,也就顺理成章了。

一开始
Anthropic根本没打算买2021年,公司成立第一年的Anthropic,压根没想过花钱买书。联创Ben Mann先下载了Books3,约18.3万份;同年6月从LibGen拿走至少500万份;2022年7月,Pirate Library Mirror再拿至少200万份。三笔加起来,超700万份盗版电子书。

七 | 毕竟,拿,比买省事。判决书里,CEO达里奥直言:本来有很多地方可以买,但走正规采购要面对一堆法务、实操和商务上的麻烦。
2024年2月,Anthropic把Tom Turvey招了进来,任务便是拿到「世界上所有的书」,还得绕开那堆麻烦。

八 | 他没再谈授权,直接从图书分销商和零售商手里批量买货:数千万美元,数百万本,很多是二手的。书运到之后是固定的三步。

九 | 液压切纸机削掉书脊,高速扫描仪把散页扫成可搜索的PDF,纸张进回收车。判决书第15页写得很清楚:剥离装订、裁切书页、扫描,然后丢弃每一本纸质原件。
斥资15亿美元,换来一张「通行证」去年6月,法官William Alsup的判决把这件事拆成三块。用书训练模型:合理使用。买来的纸书一对一转成不外传的数字副本:也是合理使用——一本进,一份出,原件已经销毁,副本总数没有变多。从盗版站下载还永久留存,不受保护,为此Anthropic赔了15亿美元。

判决书第15页:Anthropic及其供应商剥离装订、裁切书页,扫描后丢弃每一本纸质原件。对照Anthropic现在9650亿美元的估值,这笔钱占0.16%。更要紧的是它放行了什么:不是「切书」,是「买来的一本,换成一份」。原件必须消失,这套论证才成立。

十 | 也就是说,切,是这条链的承重墙,不是图省事。

十一 |

硅谷大厂跟风
开始买旧书过去十年,AI公司抢的是网页、代码、图片,抢完原件还在。现在抢的是纸书,切一本少一本,最核心的因素是「干净」。语料里最稀缺的是没被AI写过的字,行业里流行的说法是,2022年前出版的纸书不可能混进大模型生成的内容。

十二 | 《华盛顿邮报》拿到的文件里还有一层:Anthropic偏爱纸书,是因为出版物文笔好,不带那股「低质量互联网腔」。解封文件里另有一条采购要求:优先买「不那么常见」(less common)的书。不常见,往往就是绝版、印量小、市面难找。

十三 | 需求烧到了大西洋另一头。英国旧书商,最先感觉到了异常。

十四 | 他们这几个月是真赚到钱了。
诺森伯兰郡Barter Books的Stuart Manley告诉BBC,他平时一周卖两三千本,最近一笔来自加拿大公司的订单,一单就抵得上一周。干了30年二手书生意,他说没见过这种事。今年7月,图书数据服务商ISBNdb挂页面对AI公司喊话:世界上最好的AI训练数据正躺在书架上,可承接1000本到100万本的订单,为买家保密身份。页面上还有一句自白:观感问题是真实存在的,「某AI公司销毁两百万本书」不是一个能博得同情的标题。就在最新404 Media报道中,公布了另一条线。
一位书商在旧书平台Biblio接到一笔约1000本的匿名订单,书目毫无关联,买家不还价。他在其中一本书里夹了一枚苹果AirTag。追踪器从加州出发,最后停在拉斯维加斯的亚马逊LAS8设施。那栋楼平时干的是按需印刷——有人下单,这里印一本新书发出去。北端有块叫VGT3的区域,门上贴着一只霸王龙,爪子抠进书里。一名员工在内部论坛写:我们的任务就是扫书,有人负责切书,有人负责收货扫条码。

十五 | (图源:404 Media)">
亚马逊拉斯维加斯LAS8设施VGT3区域的入口标志,一只红色霸王龙爪子扣进书里。(图源:404 Media)同一栋楼,南边印新书,北边毁旧书。

十六 |

谁来负责把书留下来同样是扫书,互联网档案馆的目的正好相反:不为训练,只为把书留下,让所有人都能读到。它用的是Scribe扫描仪,一页一页人工翻。他们试过机器人翻页,但对稀有书行不通,最后还是靠人手。一位操作员十年扫了大约一万八千本书,是七十名Scribe工人中的一个。整个档案馆用了二十年,扫到第二百万本。

十七 | 全球约70名Scribe操作员,一台一台这样干了二十年。(图源:Wikimedia Commons)">
互联网档案馆的Scribe扫描工作站,书放在V形托上,人工逐页翻拍。

十八 | 全球约70名Scribe操作员,一台一台这样干了二十年。(图源:Wikimedia Commons)同样是扫书,亚马逊VGT3的流水线刚上了工时定额。一边二十年扫了两百万本,一边恨不得一天清掉一卡车。销毁与存留之间的速度差,十分刺目。但真正的问题不在快慢,而在于切下去的是哪本书。爱丁堡McNaughtan's书店的Derek Walker心中有一笔账。

十九 | 一本只印了100册、其中75册已经进了图书馆的学术书,市面上确实罕见,但毁掉一本,谈不上多大的损失。可他店里也卖出去过18世纪的某个版本,全世界只此一本。

| 它们如果进了切纸机,性质完全不同。Barter Books的Stuart Manley说得实在。世界确实不再需要五百万本《达芬奇密码》,那些书堆在库房里二十年卖不掉,现在有人整批拉走,对他是好事。但Walker卖出的18世纪唯一孤本,一旦切开就没了。更可怕的是,AI公司只按ISBN收货,是畅销书还是孤本,对于它们并没有什么区别,在那些匿名订单里是不做区分的。

| 如果真有一本孤本进了切书机,我们大概率永远不会知道。
Current article:http://www.bainangmieruopanglaomen.sbs/uk1x4j/20260826/220.docx
Published on:06:04:41