网上有多少内容出自AI生成?

2022年11月30日,OpenAI首次面向公众发布ChatGPT。

一周之后,注册用户数突破100万。发布后两个月(约2023年1月底),月活跃用户数达到约1亿,成为当时增长最快的消费级应用之一。

不到四年,约半数美国成年人表示自己使用过AI聊天机器人,其中24%的人称每天都用。

这些工具能生成酷似人类书写的文本,

由此引出一个关乎现代网络的根本问题:

如今网上有多少内容并非出自人手,而是由AI生成?

为回答这一问题,Samuel Bestvater,Aaron Smith, Carson Terbush, Chris Baronavski,以及Janakee Chavda,借助Common Crawl网络存档,收集了过去五年间近50万个英文网页,采集时间最早可追溯至ChatGPT发布数年前。

随后,他们利用这些网页文本,通过一款名为Open Pangram的AI检测工具,分析其中有多少网页可能由AI撰写或经其大幅编辑。

研究发现:

在这个样本的所有页面中,有10%显示出明显的AI撰写迹象。

随着时间推移,显示出AI撰写迹象的网页比例正在不断上升。

截至2026年7月,每十个网页中有一个(由AI撰写)或许看起来比例不高。

但互联网上的内容新老混杂。

在这些随机样本中,许多页面根本不可能是由AI撰写的。

如果从样本中滤除旧网页,只看ChatGPT发布之后发布的页面,这一趋势就更加明显了。

在2026年7月的快照中,ChatGPT发布之后发布的页面里,有超过三分之一能发现AI撰写的迹象。

这与其它研究结果一致,

NewsGuard、Originality.ai 等曾抽样发现,某些新闻/信息类网站中,相当比例的文章带有 AI 生成特征,部分样本中甚至超过 50%。

在社交媒体上,AI 生成的评论、帖子、回复机器人数量增长很快,但平台很少公开真实数据。

学术写作、邮件、代码注释等领域,AI 辅助已经非常普遍,

但“完全由 AI 生成”和“AI 辅助人类”之间的边界很模糊。

在 2022—2023 年间,AI 生成图像的数量出现了爆炸式增长,在某些特定平台或特定时间段内,AI 生成内容的占比可能已经非常高;

有研究估计,到 2023 年底,互联网上 AI 生成图像的数量可能已经超过人类拍摄/绘制的图像总量,这一说法有争议,“总量超过人类图像”缺乏可靠证据。但充分反映了增长速度。

视频方面,深度伪造和 AI 生成短视频在 2024 年后明显增加,尤其在短视频平台和广告中。

2025年,Ahrefs分析了 90万新发现的英文网页,发现 74.2%含有某种AI生成内容。

其中,2.5%的页面被归类为“纯AI”。

25.8%被归类为“纯人类”。

71.7%被归类为两者的混合。

在那些包含AI和人类内容混合的页面中:

25.86%显示出中等程度的AI使用(页面内容的11%–40%被归类为AI)

20.50%显示出大量AI使用(41%–70%)

15.51%显示出以AI为主的使用(71%–99%)

但请注意,Ahrefs试图回答的问题是:“这个网页是否包含AI生成内容?”

而Pew的问题更接近:“这个网页是否表现出显著的AI作者/编辑痕迹?”

它们实际上测量的是不同的问题。两者的门槛完全不同。

尽管人们对于“AI 生成”没有统一标准。用 AI 写初稿、人类修改,算不算?用 AI 翻译、润色,算不算?

这让统计变得非常困难。

但是,由AI撰写或经其大幅编辑的网页正在大幅度快速增加,这一点是毫无疑问的。

Samuel Bestvater等人还发现,AI撰写的文本在网络上的分布并不均衡。

ChatGPT最初发布时,能够表明AI撰写迹象的各类语言模式在主要顶级网络域名(.com、.org、.edu和.gov)中出现的比例相近。

但在2026年的样本中,.com域名下约每十个页面就有一个显示出AI撰写的迹象——这一比例约为.org域名(4.6%)的两倍,也是.edu或.gov域名(两者均约1%)的十倍。

皮尤研究中心(Pew Research Center)Samuel Bestvater等人的这篇文章探讨了自主流AI聊天机器人首次进入市场以来,这些年间AI撰写文本的迹象如何在互联网上日益增多。

文章引起了全球不少人的高度关注。

TechCrunch的报道抓住了一个很有意思的悖论:

AI is writing the web, and apparently bots are reading the web. 

也就是说,一边是AI越来越多地生产网页内容,另一边是搜索引擎、AI搜索、爬虫和其他AI系统越来越多地读取这些内容。

一些评论进一步把它与所谓 “Dead Internet Theory(互联网死亡论)” 联系起来。 

LinkedIn上就有人提出: 

如果互联网越来越多的内容由AI生产,而AI又用这些内容训练未来的AI,那么互联网可能逐渐变成“机器生产、机器阅读、机器再生产”的循环。

UC Davis数字学术负责人 William Garrity 对Pew研究的评论非常有代表性。

他认为,真正值得关注的不是单个页面究竟是不是AI写的,而是:当信息越来越丰富的时候,什么会变得稀缺?

他的回答是:Trust becomes scarce.

也就是:当信息无限的时候,信任反而变得稀缺。

这实际上把问题从“AI写了多少?”提升到了“互联网的信息生态正在发生什么变化?”

甚至我们可以进一步追问:如果越来越多文字由 AI 生成,会对人类文明产生什么影响?

如果越来越多文字由 AI 生成,会对人类文明产生什么影响?

人类文明在很大程度上依赖文字作为记忆与反思的载体。

如果大量文字由AI生成,后代回顾这个时代时,可能面对的是海量“非人类意图”的文本,历史叙事的真实性也将变得复杂。

从信息生态的视角来看,当AI撰写的文本在互联网上日益增多的时候,可能会产生内容过剩与注意力稀缺、信息真假难辨、以及存在“模型崩溃”的风险。

AI能够无限量地生产文字,但人的注意力终究有限。

其结果可能是信息噪音急剧膨胀,真正有价值的内容反而被淹没。

当AI可以模仿任何风格、制造看似权威的文本时,验证信息的成本随之上升。

人们可能愈发依赖品牌、熟人网络或算法推荐,而非独立判断。

如果AI主要用AI生成的数据来训练,可能导致质量退化、多样性丧失,形成自我强化的错误循环。

AI倾向于生成“平均化”的内容,可能使公共话语趋于平庸、重复,边缘声音与异质表达则遭到压缩。问罗文本的同质化倾向将愈发明显,创新可能会被稀释。

如果大量写作交由AI完成,人类作者可能更少进行深度思考与风格实验,长期来看或会侵蚀文化活力。

但另一方面,AI也能帮助更多人表达、翻译和创作,降低知识生产的门槛,从而释放新的创造力。

记者、文案、翻译、编剧、学术助理等职业受到冲击,部分工作被替代,部分工作则转变为“AI监督者”。

内容生产的经济模式可能改变,毕竟平台可能更倾向于低成本的AI内容。这些都可能会导致写作相关职业的重构。

AI可以大规模生成定制化的说服内容,用于政治宣传、商业营销甚至心理操控。

这势必会让宣传与舆论操控变得更加容易,公共对话的共同事实基础可能进一步瓦解,人们之间的共识更难形成。

然而,我们还应该看到,人类文明从来不是单纯人类活动的产物,工具、制度与技术,一直在塑造文明。

AI 生成内容并不必然导致文明衰退。

历史上,印刷术、广播、互联网都曾引发类似担忧:信息爆炸、真假难辨、文化同质化。

文明通过新的制度、规范和技术来适应。

关键问题不在于“是否由AI生成”,而在于人类是否仍然在决定什么值得说、什么值得信、什么值得传承。

AI正在把互联网从“人类知识库”变成“人机共同生成的知识生态系统”。

当AI开始写互联网,我们正在进入一个什么样的知识时代?

这对于全球学校教育将会产生怎样的影响?

不过,我们必须看到,AI 生成内容的比例在快速上升,更重要的不是“多少”,而是“谁在控制、为了什么、以及人类是否还能保持判断力”。

因为,问题真正的关键在于:

AI 生成内容是否可识别(透明度)?

谁对 AI 生成的内容负责(责任)?

人是否具备辨别、批判和创造的能力(教育)?以及

能否避免信息生态被少数平台和算法垄断(公共治理)?

如果这些方面做得好,AI 可能成为文明的一种“认知基础设施”,帮助人类处理复杂问题;

如果做得不好,它可能加速信息污染、信任瓦解和话语平庸化。

您说,是这个理不?

欢迎跟帖分享您的主张! 🙂 

2023年9月28日 和4位访问学者在一起