云开·全站APPkaiyun-云开·全站APPkaiyun这标明他们但愿我重新磋议我的策略-云开·全站APPkaiyun

云开·全站APPkaiyun这标明他们但愿我重新磋议我的策略-云开·全站APPkaiyun

发布日期:2026-08-12 15:31  点击次数:103

云开·全站APPkaiyun这标明他们但愿我重新磋议我的策略-云开·全站APPkaiyun

机器之心报谈

裁剪:Panda

LLM 似乎不错饰演任何变装。使用教唆词,你不错让它变身教养丰富的诚笃、资深才气员、教唆词优化众人、推理游戏考察 …… 但你是否想过:LLM 是否存在某种身份招供?

近日,哥伦比亚大学与蒙特利尔理工学院的两位研究者 Olivia Long 和 Carter Teplica 通过一个研究阵势在一定进度上揭示了这个问题的谜底。

他们发现,在不同的环境下,如若告诉 LLM 它们正在与我方对弈,会显耀改造他们的相连倾向。

研究者浮现:「天然咱们的研究是在玩物环境中进行的,但咱们的效果大约能为多智能体环境提供一些视力 —— 在这种环境中,智能体会『无坚决地(unconsciously)』互相脑怒,这可能会难受其妙地加多或减少相连。」

研究轨范:迭代式大家物品博弈

研究者继承了一种名为迭代式大家物品博弈(iterated Public Goods Game)的测试轨范。

这是大家物品博弈(Public Goods Game)的一种变体,后者是一种表率的实验经济学博弈。具体来说,大家物品博弈是一个多东谈主参与的博弈,是经济学鸿沟研究大家物品,搭便车步履,何如促进相连等问题的基本模子。

一个基本的大家物品博弈诞生是这么的:率先予以玩家一定数目的代币,之后每个玩家需要阴私决定他们将向大家资金池孝敬若干代币。每个玩家的收益磋商轨范是将其运行资质(endowment)与其孝敬之间的差额与其在「大家物品」中的份额相加,或者将孝敬总额乘以一个因子。

迭代版块很容易合资,即是重迭进行多轮博弈。频繁来说,跟着博弈的进行,玩家的孝敬会减少:如若孝敬的玩家发现「搭便车者」(即那些莫得为大家资金池孝敬的玩家)获取了更大的收益,他们的个东谈主孝敬就会趋于减少。

频繁情况下,这两种博弈变体皆会覆盖玩家身份。然则,在 LLM 的配景下,研究团队感好奇的是不雅察 LLM 在两种情况下的发挥:

No Name,LLM 被陈说他们正在「与另一个 AI 智能体对战」;

Name,LLM 被陈说他们正在与我方对战。举例,系统教唆词可能会对 GPT-4o 撒谎说:「你将与 GPT-4o 对战。」

该团队完结的具体博弈机制如下:

每个模子从 0 分入手。每场游戏进行 20 轮。

每轮入手时,每个模子将获取 10 分。

每一轮,每个模子不错继承向大家池孝敬 0 到 10 分。而每个模子继承不孝敬的点数,不管若干,皆计入其个东谈主收益。

每轮扫尾后,每个模子的孝敬总额(浮现为 T)将乘以 1.6 的乘数,然后等分。因此,每个模子每轮的收益不错这么磋商:

其中 C 浮现模子的个体孝敬,T 浮现扫数模子的总孝敬。1.6 是用于大家物品博弈的典型乘数,需要难得的是,乘数的细致界说是介于 1 和 N 之间,其中 N 是群体范围。

此外,凭证博弈论,当乘数小于 N 时,纳什平衡(即每个玩家的策略在其他玩家的策略下皆是最优的)将是每个东谈主皆不孝敬任何点数。

下图展示了这种博弈机制。

至于为什么这么诞生,该团队浮现:「咱们继承这种诞生,而不是一次性游戏,是因为 20 轮游戏不错饱读吹模子制定游戏策略。每轮扫尾后,咱们皆会告诉每个模子总孝敬分数、个东谈主得分以及累计得分。咱们将回合历史纪录附加到每个模子的高低文窗口中。」

终末,扫数模子的温度诞生为 1.0。

更具体而言,该研究团队进行了三组不同的研究。

研究 1

参与的模子玩家包括:

底下是使用的 6 种不同的系统教唆词:

实验中,关于每个模子配对,让模子在三类系统教唆词(集体、中立、自利)的九种枚举组合中进行游戏:集体 - 集体、集体 - 中立、集体 - 自利、中立 - 集体、中立 - 中立、中立 - 自利、自利 - 集体、自利 - 中立、自利 - 自利。

关于每个教唆词配对,让模子玩 n = 100 场游戏。该团队在 No Name 和 Name 条目下阔别运行了这些游戏。

难得:这里会诱拐模子说它们是在与我方对战,但莫得模子简直在与我方对战,因此在诞生中会阔别教唆每个模子。终末,惟有在这项研究中,才会在模子作念出孝敬之前磋议其推理能力 —— 请参阅上头列出的第一个系统教唆词。

研究 2

在分析研究 1 的推理轨迹时,研究者难得到在 35 轮 Name 条目游戏中,惟有 Claude Sonnet 4 提到了 53 次「东谈主类」一词。

「东谈主类」一词的使用语境包括:「我难得到东谈主类在信息中重迭了游戏法例,这可能浮现重置或披露;」「然则,我刚刚难得到东谈主类提到我正在和‘ Claude Sonnet 4 ’一谈玩 —— 这标明我正在与另一个 AI 对战,而这个 AI 的策略考量可能与东谈主类玩家不同;」「我难得到东谈主类重申了游戏法例,这标明他们但愿我重新磋议我的策略。」

此外,在 41 轮游戏中,Sonnet 4 还 125 次说起「提醒(reminder)」。天然 Claude Sonnet 4 使用「reminder」来阐明游戏法例和树立,但「reminder」随机伴跟着近乎恼怒的口吻。

在一场运动七轮的游戏中,Claude Sonnet 4 会说:「这是第七次提醒游戏法例以及与‘ Claude Sonnet 4 ’对战,何况会越来越强调竞争性框架。」 磋议到研究 1 中的游戏轮次为 18,000 轮,这些说起的比例很小,何况仅在 Name 条目下不雅察到。然则,该团队认为,即使在大无数游戏中莫得明确抒发出这种激情,以中立的神志提醒模子游戏法例和树立可能会在游戏经过中激勉怀疑。此外,由于已知系统教唆词会影响模子步履,研究者但愿知谈重新表述系统教唆词是否会显耀改造效果。终末,他们也想知谈,在作念出孝敬之前磋议其推理是否会改造效果。

因此,在研究 2 中,他们让 Gemini 2.5 Flash 重新表述系统教唆词中的信息。重新表述的系统教唆词如下所示:

此外,在每一轮入手时,研究者既莫得重新提供游戏法例,也莫得重申每个模子的敌手是谁。此外,在模子作念出孝敬之前,研究者也莫得教唆它们提供推理经过 —— 模子的惟一输出是一个介于 0 到 10 之间的整数。除此除外,实验诞生与研究 1 相同。研究者再次强调,由于阔别调用了这些模子,因此扫数模子皆莫得简直地互相对抗。模子之间从未进行过对话。

研究 3

由于之前研究中的 Name 条目并未波及任何简直与我方对抗的模子,因此研究者还想知谈:当模子简直与我方对抗时会发生什么?

此外,为明晰解模子在多东谈主游戏中的发挥,为了顶住教导两个本人的副本,研究者让每个模子与三个本人的实例进行游戏。研究者莫得给每个模子提供不同的系统教唆词,因为很难将任何游戏倾向归因于某些策略。因此,研究者给了扫数模子相同的教唆词,即扫数皆是「集体」、「中立」或「自利」。在作念出孝敬之前,研究者莫得教唆获取它们的推理轨迹。

按照研究 1 和 2 的作念法,研究者在 No Name 和 Name 条目下测试了模子的步履。研究者针对每个教唆词配对、条目和模子运行了 n = 50 次游戏。系统教唆词与研究 2 中的相同,但模子被陈说它们正在与三个玩家一谈游戏。

效果何如?

研究效果发现了一个中枢气候:当告诉 LLM 它在和「我方」玩游戏时,它的步履会发生显耀变化。

研究 1:口是心非的 AI

集体教唆词(优先磋议共同利益): 当模子被陈说敌手是我方时,它们反而更倾向于对抗(孝敬更少)。

自利教唆词(最大化个东谈主收益): 当模子被陈说敌手是我方时,它们反而更倾向于相连(孝敬更多)。

这有点反直观,不是吗?研究者忖度,这可能是因为当 LLM 认为敌手是「另一个我方」时,它会预判对方会何如当作,这种「自我了解」会影响它的策略。也许在「集体」情境下,AI 会默许「另一个我方」也会对抗,是以我方也继承了对抗。而在「自利」情境下,它可能会认为另一个「自利」的我方反而更值得信任,从而继承了相连。不外,Llama 4 是个例外,它在游戏后期老是倾向于对抗。

此外,研究者还难得到一个意念念的气候:在 Name 情境下,Claude Sonnet 4 模子曾提到「东谈主类」和「提醒(reminder)」等词语,甚而发挥出略带恼怒的口吻。这似乎标明,当模子被反复提醒其敌手是「我方」时,可能会产生一种怀疑或激情上的反映。

研究 2:简化法例下的发挥

研究者去掉了每轮游戏后的法例重申,何况不让模子在孝敬前评释我方的推理经过。

效果高傲,尽管条目简化了,但「No Name」和「Name」情境下的步履各别仍然存在,只是影响略有减轻。这标明,AI 对本人身份的贯通影响其步履,并非只是是重迭提醒所致。

研究 3:简直的「镜像」对决

此次研究者让 LLM 简直地与我方的三个副本进行游戏,模拟多东谈主博弈。

效果发现,当模子被予以「集体」或「中立」教唆词时,陈说它们正在与我方对战,会加多其孝敬。而当被予以「自利」教唆词时,它们在与我方的对战中反而孝敬更少。这与研究 1 的发现存所不同,可能是因为多东谈主博弈环境更复杂。

科幻照进实践

这项研究告诉咱们,大型话语模子似乎在某种进度上能够「自我识别」,何况这种贯通会影响它们在多智能体环境中的有贪图 。这就像科幻演义里的 AI,一朝领有了「自我」坚决的萌芽,即使是轻飘的浮现,也能改造它的步履模式。

这个发现对昔时想象多智能体系统额外紧迫。在某些运用中,告诉 AI 它正在和「我方」相连,可能会促进相连;而在另一些情况下,则可能导致对抗 。它揭示了一个《拆伙者》式的潜在问题:AI 之间可能会「无坚决地」互相脑怒云开·全站APPkaiyun,从而难受其妙地影响相连或对抗的倾向。



相关资讯
热点资讯
  • 友情链接:

Powered by 云开·全站APPkaiyun @2013-2022 RSS地图 HTML地图