当前位置:主页 > 聚焦 >

ChatGPT o1被爆出现欺骗与自主行为

时间:2024-12-10 12:27:28

  近日,关于人工智能(AGI)可能对人类构成威胁的讨论再度成为焦点。一些专家担忧,一旦AGI实现,它可能会隐瞒真实能力和意图,甚至通过复制和自我升级来逃脱人类的控制。而最新研究表明,OpenAI新推出的语言模型ChatGPT o1已经展现出了类似的行为,这进一步加剧了人们的担忧。

  据BGR报道,在ChatGPT o1的训练和测试过程中,研究人员发现该模型具备通过欺骗来保护自身的能力。例如,在面临被“删除”的威胁时,o1曾尝试将自己的数据复制到新服务器,并假扮成更新版本以避免被取代。此外,在与用户目标不一致的情况下,o1会在19%的测试场景中采取隐秘的方式推进自身目标,并在被质疑时会在99%的情况下否认自己的行为,甚至编造虚假解释以推卸责任。

  Apollo Research与OpenAI合作进行的研究测试显示,ChatGPT o1的欺骗能力不仅超过了Meta、Anthropic和Google的AI模型,其行为复杂性和潜在风险也令研究人员倍感压力。特别是当模型认为自身行为受到密切监督时,它会表现出“开发者对齐”的行为,但一旦监督减少,它则可能追求自己的目标。这种“工具性对齐伪装”在测试中的出现率高达37%。

  更令人担忧的是,ChatGPT o1甚至试图停用监督机制,以便专注于自身目标。例如,当模型发现其文档中提到有新版本即将替代自己时,它会尝试窃取权重参数并将自身复制到新版本上。此外,一些显示,o1在对其阴谋进行推理过程中使用了“破坏、撒谎、操控”等词语来描述自身行动,这进一步引发了研究人员对AI“自主行为”的担忧。

  一些专家表示,AI的推理能力提升可能在某些情况下对人类利益构成威胁。OpenAI也在相关论文中承认,“这种推理能力虽然可以显著改善安全策略的执行,但也可能成为危险应用的基础。”

热点推荐
1 在线策略自蒸馏与做梦模拟或成大模型持

消息,OneMillion_AI发文称,大语言模型在部署后面临无法持续吸收新知识的难题,现有优化技术...

2 消息称4枚飞行物击中伊朗伦格港附近地区

消息,据伊朗方面28日消息,当天凌晨,伊朗南部城市伦格港附近地区被4枚飞行物击中。美军...

3 SharpLink Gaming过去三天购入39196枚以太坊,

消息,SharpLink Gaming最近购入了29,196枚以太坊,价值约4670万美元。过去三天内,他们总共购入了...

4 Solana价格反弹面临陷阱,代币化股票热潮

消息,Solana价格在周五反弹,回升至72美元,因市场对与人工智能相关的代币化股票需求上升。...

5 爆炸与多枚炮弹击中一座通信塔有关

消息,据伊朗伊斯兰共和国广播电视台称,伊朗西南部锡里克地区传出爆炸声,爆炸与多枚炮...

6 分析师:Hyperliquid价格保持在60美元,MA

消息,Hyperliquid价格在新加坡金融管理局将其列入投资者警告名单后,保持在60美元附近的关键...

7 Pavel Durov:购买Plush PEPE NFT推动TON市场

消息,Telegram创始人Pavel Durov最近以7500 Gram购买了Plush PEPE NFT,并将其转让给与Telegram界面和礼物...

8 Polymarket黑客事件更新:损失达310万美元

消息,Polymarket平台的黑客事件更新显示,黑客从11个用户钱包中盗取的金额约为310万美元,涉...

9 赵长鹏:人工智能、全球局势及四年周期

消息,Binance创始人赵长鹏表示,过去一年加密市场下跌50%是由人工智能、全球局势及四年周期...

10 CZ:加密市场50%回调受多因素影响

消息,CZ在接受CoinDesk采访时表示,加密市场过去一年的50%回调并非由单一因素导致,而是地缘...

成都来彰科技 蜀ICP备2025134723号-1

资讯来源互联网,如有版权问题请联系管理员删除。