IT之家 8 月 14 日消息,Anthropic 公司所做的一些事务中,让普通人觉得比较诧异的可能就数处理训练书籍的方法了。这家公司购置了数百万册二手书,将其书脊切除后再扫描里面的文字,用来训练 AI 模型,训练工作结束之后又将原书处理掉。不少人知道这种做法会很不愿意接受,但 Anthropic 公司实际上“依照了版权法”的规则。法律准许个人将自己持有的书籍数字化,条件是在这个过程当中并没有额外再增添一份复本。在一件备受关注的事件里,美国一位联邦法官也判定,Anthropic 公司的这一做法属于合理使用。
长久存在争议的,是 AI 模型训练完成利用已经习得的内容创造新作品,会对原作产生何种影响。
美国版权局在去年对此进行了探讨,并且点出了 AI 公司在抗辩时最大的一个薄弱环节。合理使用需要从四项因素进行考量,其中一项是新作品能否损害原作品的市场。
美国版权局觉得,如果利用受版权保护的作品生成商业性质的内容,然后让这些生成的内容与原来的作品争市场,就超出了传统合理使用的范畴。
《商业内幕》在 14 日报道里提到,以前最大的难题,是很难证明这种市场损害真的存在。但现在,研究者已经找到了部分佐证材料。
研究者们最近分析了 2023 年到 2026 年间在亚马逊售出的 1.4 万多本电子书,发现不少图书里含有大量 AI 生成的文本,而且它们的数量已经多到足以威胁到其他图书的市场位置。有销量的图书数目增长到了原来的 19 倍,而读者在这些图书上所花费的总金额却仅增加了原来的 9 倍。
换言之,市场变得更加拥挤,整体规模却没有以同等速度扩大,单本图书分到的平均收入因此减少。IT 之家从这篇报道了解,研究者们还发现,随着含有 AI 生成文本的图书数目持续上升,未检测出 AI 文本的图书市场份额在减少。
AI 几乎可以零成本大量生成数千本图书,人类作者因此不得不与大量新增内容展开竞争。但假设没有人类作者原本的作品,这些内容也不会面世。
Fairly Trained 这个非营利组织的 CEO 埃德·牛顿-雷克表示,AI 公司一直声称,模型不会让那些作品被用于训练的创作者蒙受经济损失,但是这项研究成果已经让这个主张“彻底站不住脚了”。








网友评论