《Science》报道的核心事件,是一套名为 ConlangCrafter 的人工智能系统能够自动设计“人造语言”:不仅生成一批看似陌生的单词,还能制定发音体系、语法规则、词形变化、基本词汇,并把英语句子翻译成这种新语言。报道由此提出了一个更深层的问题:当AI能够产生前所未有、结构完整的作品时,这究竟算不算创造力?(科学组织)

总体判断是:
ConlangCrafter确实展示了较强的“结构性生成能力”和“组合式创造力”,但它还没有证明AI具备与人类相同的自主创造力。它创造的更准确说是“语言设计方案”,而不是已经形成文化、历史和使用共同体的真正语言。
一、它并不是让大模型“一句话凭空造语言”
ConlangCrafter不是一个新训练出来的独立基础模型,而是一套围绕现有大语言模型建立的多阶段工作流。研究团队使用了Gemini 2.5 Flash、Gemini 2.5 Pro和DeepSeek-R1等模型,将造语言这一复杂任务拆成多个连续环节:
- 设计音系,即这种语言有哪些元音、辅音或其他表达单位;
- 设计形态和句法,包括词语如何变化、主语谓语宾语如何排列;
- 建立词汇;
- 根据规则翻译句子并生成逐词语法注释;
- 检查生成内容是否与既定规则冲突;
- 发现矛盾后重新修改。
所有规则都被保存在一份持续更新的“语言草图”中。后面的词汇和翻译必须遵守前面制定的规则;新词和新语法也可以反向补充进规则库。(ACL Anthology)
这套架构的重要性在于,它没有把造语言当成普通文本续写,而是当成一个需要长期维护约束的系统工程。它的思路与软件开发中的“需求定义—模块设计—测试—纠错”更接近,而不是简单要求聊天机器人“给我编一种外星语言”。
二、真正起作用的是“随机选择+分层生成+自我纠错”
ConlangCrafter主要依靠三个机制解决大模型造语言时的两个常见问题:不同结果过于相似,以及前后规则互相矛盾。
第一是多步生成。
系统依次处理音系、语法、词汇和翻译,避免在一个提示词中同时生成整套语言。论文的消融实验显示,仅仅加入多阶段推理,就能显著提高生成语言之间的结构差异。
第二是外部随机数。
在音系和语法阶段,大模型先列出语言学特征及多个备选方案,例如采用SVO还是SOV语序、是否存在声调、属于孤立语还是黏着语。随后由外部随机数生成器选择组合,再让大模型把这些选项发展成完整规则。这样可以避免模型总是回到英语或其他常见语言的结构。
第三是自我修订。
同一个基础模型分别扮演“批评者”和“编辑者”:前者寻找矛盾、含混和遗漏,后者依据批评结果修改规则或翻译,直到没有发现新问题,或者达到最大迭代次数。
这项研究还有一个很有意思的认识:在这里,大模型通常被批评的“幻觉”反而被当成了资源。因为目标本来就是创造不存在的词汇和规则,虚构不再是错误;真正需要控制的是虚构内容能否保持内部一致。
三、实验结果说明了什么
研究人员选取了世界语言结构地图WALS中的16项语言类型学特征,用它们比较不同人造语言之间的差异,同时测试每种语言能否正确翻译10个具有不同句法结构的测试句。
以Gemini 2.5 Pro为例:
- 普通单提示方法的多样性得分为0.26,ConlangCrafter提高到0.58;
- 一致性得分由0.32提高到0.54。
使用Gemini 2.5 Flash时,多样性由0.25提高到0.60;使用DeepSeek-R1时,由0.35提高到0.56。不同模型上的一致性也总体有所改善,不过Gemini 2.5 Flash的一致性增幅在该样本规模下没有达到统计显著。
在同一套16项指标下,1874种自然语言的平均多样性得分约为0.43,而ConlangCrafter生成语言的得分约为0.56至0.60。这说明系统能够拼出自然语言数据库中较少见的类型学组合。对Gemini 2.5 Pro生成语言进行最近邻比较时,它们与最接近的自然语言平均只有56.4%的可比较特征相同。
但这些数字不能被解释为“AI生成的语言比人类语言更丰富”。它们只表明:**在研究者挑选的16个离散类型学维度上,系统有意进行随机组合,因此产生了更分散的结果。**真实语言的丰富性还包括庞大的词汇、语义歧义、隐喻、礼貌规则、文化知识、历史演化和社会差异,这些并未被上述分数衡量。
更值得注意的是,表现最好的Gemini 2.5 Pro,其严格意义上的翻译一致性也只有0.54。也就是说,大约只有一半测试翻译被自动评估为完全符合语言自身的全部规则。研究人员自己也承认,生成完全一致的翻译仍然很困难。
四、“外星章鱼语言”为什么引人关注
研究团队还要求系统设计一种供外星头足类动物使用的语言,不使用人类语音,而是以颜色变化和触手动作传递信息。
系统由此设计了类似“色素音位”和“动作音位”的表达单位:颜色可以包含静态或脉冲变化、冷暖色调等特征;触手卷曲等动作相当于发音单位;水中的运动轨迹甚至被设计成类似声调的附加信息。
这个案例并不能证明AI发现了章鱼真实的语言,却表明它能够把“语言”从人类声音系统中抽象出来,理解为:
一套有限的符号单位,按照稳定规则组合,用于表达对象、动作、关系和状态。
这种抽象迁移能力,是ConlangCrafter最有研究价值的部分。它不仅在已有词汇之间进行替换,还能把音系、语法和表达介质作为可重新设计的系统部件。
不过,该例子也是在研究人员明确给出“头足类、颜色和动作”等约束后产生的。真正突破“语言必须依靠声音”这一前提的创意,很大程度上来自人的任务设定;AI负责的是在这一设定中补充结构细节。

五、这算不算创造力
《Science》报道呈现了两种对立意见。
理论语言学家Joseph Windsor认为,系统的工作在相当程度上类似掷骰子:随机选择动词在宾语前还是后、是否有某种辅音、采用哪类词形变化。骰子最终也能选出一整套组合,但人们通常不会把骰子称为有创造力。他还强调,语法可以判断一个词放在哪里,却不能决定这个词是否在审美上“感觉正确”。(科学组织)
计算科学家Ganesh Bagler则提出相反意见:人类创造同样大量依赖组合。厨师重新搭配已有食材,音乐家重新组织既有音符和风格;如果人类的许多创造活动本质上也是组合,便不能仅因AI使用已有元素,就否认它的创造性。(Reddit)
两种观点其实使用了不同的“创造力”定义。
按照结果来判断,ConlangCrafter显然具有一定创造性:它可以产生过去没有出现过、同时又具备部分实用规则的新结构。
按照生成过程判断,其创造性较为有限:候选空间、语言学维度、随机机制、评价标准和纠错流程都是人类预先设计的。
按照意图和体验判断,目前没有证据表明它理解自己为什么要创造某种语言,也没有审美偏好、表达欲、文化经验或交流需求。
因此,更合理的说法是:
它表现出了产品层面的新颖性和探索性,但尚未表现出人类意义上的创作意图。
将它称为“组合式创造力”或“机器辅助的探索式创造力”,比直接宣布“AI已经拥有创造力”更准确。
六、为什么它创造的还不是真正意义上的语言
语言不只是一份语法说明书。真实语言是在群体长期交流中形成的社会系统。
一个词最初可能表示具体物体,后来产生隐喻义;年轻人可能改变词义;不同地区形成方言;错误用法可能因广泛传播而变成正确用法;政治、技术、宗教和生活方式也会不断改变语言。语言的规则不是设计完成后永久固定,而是在使用过程中持续协商和演化。
苏黎世大学语言学家Balthasar Bickel指出,ConlangCrafter目前没有处理语言随时间演变的问题。《Science》报道还借构造语言的发展说明,即使一种语言最初由个人设计,其词汇和意义也会在使用者共同体中不断扩展。研究团队计划让多个AI智能体学习并使用同一种人造语言,观察它们是否会创造新词、新含义和新的交流约定。(科学组织)
换言之,ConlangCrafter目前生成的是一份静态语言规范,而真正的语言是一个动态社会过程。
七、研究最重要的意义不在“取代语言创造者”
1. 成为大模型语言推理能力的压力测试
由于目标语言在生成前并不存在,模型难以直接从训练资料中复述答案。它必须理解抽象规则,并把规则迁移到新词和新句子中。这比测试模型能否背诵某种自然语言的语法,更能考察其元语言推理能力。
但“目标语言不存在”并不意味着系统完全脱离训练数据。它仍然依赖训练过程中学到的语言学术语、世界语言结构和人造语言案例。它的新颖性主要来自对这些知识的重新组织,而不是从零发现语言规律。
2. 为自然语言处理提供可控实验环境
研究人员可以生成大量只有某一项结构不同的语言,例如保持词汇相同,只改变基本语序;或者保持语法相同,只改变词形复杂度。这样便能系统研究语言结构如何影响模型学习和推理,而真实语言很难提供如此严格的变量控制。(IEEE Spectrum)
3. 服务游戏、影视和虚拟世界
大型游戏或虚拟社会需要大量族群、历史和语言设定。ConlangCrafter可以快速生成候选音系、语法和词汇,再由人类设计者选择和修改。它更可能成为“语言设计CAD”,而不是完全替代专业造语者。(ACL Anthology)
4. 探索多智能体语言演化
未来如果多个智能体在不同环境中长期使用人造语言,研究人员可以观察词义漂移、方言形成、简化和复杂化等现象。这既可能帮助研究语言演化,也可能用于分析AI智能体是否会形成难以被人类解释的内部交流规则。
后一方向具有AI安全意义:系统若为了效率自行形成压缩代码,人类可能越来越难以监督其交流。因此,研究重点不应只是“语言有多奇怪”,还应包括其是否可解释、可翻译和可审计。
八、当前研究的主要局限
论文作者明确列出了多项限制:
- 系统仍可能偏向英语及其他高资源语言;
- 语言类型学资料本身没有覆盖世界上所有语言现象;
- 当前语言草图主要包括音系、形态句法和词汇,基本没有处理语义、语用、篇章策略和书写系统;
- 语言描述规模远小于真实语言;
- 多轮长上下文调用和自我修订需要较高计算成本。
评估方法也存在明显问题。实验通常只生成约20种语言,每种测试10个句子;大规模评分由另一个大模型完成,人工验证则主要由两名语言学博士生承担,总计约35小时。自动评价与人工评价的相关系数为0.68,属于中等程度的一致,而不是完全可靠。
此外,多样性指标可能鼓励系统把罕见特征拼在一起,却不判断这种语言是否容易学习、能否高效交流,或者是否具有审美价值。“不同”不等于“好”,“罕见”也不等于“有创造力”。
结论
ConlangCrafter的真正突破,不是证明AI已经像人类一样拥有想象力,而是证明现有大语言模型经过合理编排后,可以完成一种过去需要专业语言学知识和大量人工劳动的复杂开放式设计任务。
它能够:
- 建立相对完整的语言规则;
- 生成结构上较新颖的组合;
- 使用这些规则翻译新句子;
- 检查并修改自己的部分错误;
- 接受声音以外的交流介质等特殊设定。
但它还不能:
- 稳定维持大规模、长期一致的语言体系;
- 建立完整语义、语用和文化背景;
- 通过真实群体互动形成语言演化;
- 解释自己为何认为某个词或结构“更好”;
- 证明自身具有目的、体验和创作意图。
因此,这项研究更适合被理解为:**AI正在从内容生成器演化为规则系统设计器和创造性搜索工具。**它未必拥有人的创造力,却已经能够扩展人类可以探索的设计空间。
就“AI是否有创造力”这个问题而言,ConlangCrafter没有给出最终答案,但它迫使人们把问题说得更精确:我们讨论的究竟是新颖的结果、有效的组合、独立的意图,还是能够被社会接受并持续发展的文化创造?不同定义,可能会得到完全不同的答案。
相关报道:An AI can invent entirely new languages. But is it creative?
ConlangCrafter系统: https://conlangcrafter.github.io/
相关论文: ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline