在中国,人工智能是一条自食其果的蛇
中国最大的技术雄心和最大的政治痴迷正在悄然相互摧毁。
党为了控制其人民而建立的审查机制,现在正在腐蚀其领导者所依赖的人工智能系统。美国通过倾向于开放的信息和思想市场,将在不同的道路上获得优势。
人工智能正在越来越多地训练更新、更快的AI模型。这通常涉及从互联网抓取内容,然后将其加载到新程序的数据集中。问题在于:用于训练的在线内容越来越多地由人工智能生成。因此,每一代技术都逐渐偏离现实。
人工智能研究人员将此称为“模型崩溃”,这是一个现象,其中基于自身合成输出训练的模型在连续几代中退化。唯一的防御是不断涌入新鲜、真实的人类生成信息。没有它,系统就会自我崩溃。
中国的“长城防火墙”切断了这种涌入,加速了其境内模型崩溃的影响。全球第一代大型语言模型是在大量公开可用的人类生成文本数据集上训练的。这些人类衍生的信息构建了一个算法近似,模拟人们的思维、争论、解释和沟通方式。
现在,互联网充斥着五年前难以想象的AI生成内容。营销文案、产品描述、社交媒体标题和新闻摘要越来越多地由人工智能系统生成并在线发布。它们都变得通用,与人类信号脱节。
随着每一轮新人工智能的出现,模型与其人类起源的距离越来越远。更新的系统放大了人工智能系统所偏好的模式,同时失去了细微差别并放大了现有偏见。每一代人工智能都比这些程序最初为之服务的人类更进一步。
在中国,“长城防火墙”加速了这个问题。中国公安部在1990年代末建立了中国的“长城防火墙”以审查中国人民。它现在是人类历史上最复杂的信息控制基础设施。“长城防火墙”不仅限制中国用户可以看到的内容。它还塑造了用于训练中国人工智能系统的数据。按设计,它剔除了政治敏感事件、异议观点和独立报道。留下的是与党的叙述相一致的现实经过筛选的记录。这种经过过滤的信息记录成为大型语言模型的原材料。
输入到中国大型语言模型中的训练数据不包含对政府的任何批评、对争议话题的公正报道或关于中国历史的准确信息。像维吾尔人拘留营这样的事件在防火墙内仅存在于国家选择描述的方式中。
现在再加上模型崩溃。百度、阿里巴巴、字节跳动等中国人工智能公司在其平台上积极部署AI生成的内容。这些材料成为下一代中国人工智能模型的训练数据。由于独立报道被锁定,模型崩溃在“长城防火墙”内加速,没有逃生阀。这种分歧的实际后果已经显现,并将加速发展。
中国的大型语言模型在需要新观察、原创综合或人类复杂性的任务中挣扎,而这些训练数据的设计正是为了抑制这些特征。如果被问及中国历史中的压制或像维吾尔人拘留这样的争议时事,这些大型语言模型要么不回答,要么产生的回应与党的新闻稿无异。依赖国内人工智能来模拟西方制裁经济影响的中国贸易官员,正在使用一个无法提供关于这些制裁如何运作或在可比历史案例中失败的诚实叙述的系统。
西方也面临着这种问题的温和版本……
中国的人工智能系统因防火墙的审查而恶化,这限制了对多样化信息的访问。这种模型崩溃影响了各个领域的决策,因为基于偏见数据训练的人工智能模型无法提供准确的见解。美国受益于更开放的信息环境,从而促进了更好的人工智能发展和应用。
- 中国的防火墙限制了对真实信息的访问,导致人工智能系统的模型崩溃。
- 中国的人工智能模型在需要原创综合的任务中表现不佳,原因是训练数据存在偏见。
- 由于开放的信息环境,美国在人工智能方面具有竞争优势。