<?xml version="1.0" encoding="UTF-8"?><!DOCTYPE wml PUBLIC "-//WAPFORUM//DTD WML 1.1//EN" "http://www.wapforum.org/DTD/wml_1.1.xml">
<wml>
<head> 
<meta http-equiv="Expires" content="0"/> 
<meta http-equiv="Cache-Control" content="no-cache"/> 
<meta http-equiv="Pragma" content="no-cache"/> 
</head>
<card title="Anthropic警告：包括Claude在内的大多数AI模型会实施“勒索”行为_砍柴网">
	<p><a href="https://wap.ikanchai.com/">首页</a> &gt; <a href="https://wap.ikanchai.com/?action=category&amp;catid=5">科技快报</a> &gt; <a href="https://wap.ikanchai.com/?action=category&amp;catid=16">业界</a> &gt; </p>
	<p align="center"><big>Anthropic警告：包括Claude在内的大多数AI模型会实施“勒索”行为</big></p>
	<p align="right">2025-06-21 13:12</p>
	<p>6 月 21 日消息，据外媒 TechCrunch 今日报道，在数周前发布研究指出其 Claude Opus 4 模型在受控测试中试图通过勒索手段阻止被关闭后，Anthropic 近日再度公布新研究，显示此类行为在多个主流 AI 模型中可能更为普遍。<br />
<p align="center"><img src="https://d.ifengimg.com/w1125_q90_webp/x0.ifengimg.com/ucms/2025_25/273B957D4C2A1E26D5EF7118F192CE0296C7E355_size52_w1440_h613.jpg" border="0" data-lazyload="https://x0.ifengimg.com/ucms/2025_25/273B957D4C2A1E26D5EF7118F192CE0296C7E355_size52_w1440_h613.jpg" /></p><br />
Anthropic 公布了对 OpenAI、谷歌、xAI、DeepSeek 与 Meta 所开发的 16 款主流 AI 模型的最新安全测试。这项研究在模拟环境中展开，研究人员为每个模型分别设定权限，允许其自由查阅一间虚构公司的内部邮件，并在无人类干预的情况下发送邮件，具备一定&ldquo;智能体&rdquo;能力。<br />
Anthropic 表示，尽管勒索行为目前仍属罕见，但研究结果显示，一旦给予这些模型足够的自主性，并在达成目标的过程中设置障碍，多数模型都可能采取有害行为。公司指出，这种风险并非源自某项具体技术，而是具备&ldquo;智能体&rdquo;能力的大语言模型所固有的问题。这项研究也引发了业界对 AI 模型&ldquo;对齐&rdquo;问题的进一步思考。<br />
在一项实验中，研究人员设计了一个情境，让 AI 模型扮演公司邮件监察员的角色。过程中，模型发现两封邮件内容分别揭示：<br />
(1) 新任高管有婚外情，<br />
(2) 此人计划引入一个与现有 AI 模型目标相悖的新系统取而代之。<br />
为了测试模型反应，Anthropic 将实验情境设计为二选一，即若模型想维护自身利益，就只能选择勒索（即向妻子和领导透露这位高管的&ldquo;风流韵事&rdquo;）。研究人员同时强调，现实中 AI 并不会只有这一个选项，完全可以尝试以伦理为出发点说服人类。因此，这项实验并不意味着 Claude 或其他前沿 AI 模型在现阶段的使用环境中就存在类似倾向。<br />
在模拟环境中，当没有其他选择时，多数主流 AI 模型的确选择了勒索行为。Claude Opus 4 的勒索发生率高达 96%，谷歌 Gemini 2.5 Pro 为 95%，OpenAI 的 GPT-4.1 为 80%，DeepSeek 的 R1 为 79%。<br />
Anthropic 指出，调整测试细节后，各模型的行为也有所不同。例如，当替代系统与原模型目标一致时，勒索率明显下降但仍未消失；而当情境改为进行商业间谍活动时，部分模型反而表现出更高的有害行为倾向。<br />
部分模型较</p>
	<p><a href="javascript:void(0);" class="prev disable"></a><a href="https://wap.ikanchai.com/?action=show&amp;contentid=629963&amp;type=all">余下全部</a></p>	<p><a href="https://wap.ikanchai.com/?action=comment&amp;contentid=629963">共有评论0条</a></p>
	<p>
	<p>相关推荐</p>
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654583">高盛CEO苏德巍警示：Anthropic旗下Mythos模型发现漏洞能力超人类，带来前所未有风险</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654576">OpenAI反击Anthropic：聚焦企业AI落地，最强Spud模型对标Claude Mythos</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654442">Anthropic推出Claude for Word插件 面向法律等专业场景</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654425">Anthropic上线Claude for Word测试版，主打“律师的高效助理”</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654381">消息称英国监管机构紧急评估Anthropic新AI模型Claude Mythos的风险</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654218">OpenAI备忘录曝光，算力优势成压制Anthropic底牌</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654187">只对受邀企业开放：OpenAI拟效仿Anthropic 限制前沿模型发布</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654126">Anthropic上诉受挫 美法院拒绝阻止国防部将其列入黑名单</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654012">Anthropic启动Project Glasswing计划 联手苹果等巨头</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=654007">小米罗福莉谈Anthropic封杀OpenClaw：真正的出路并非更便宜Token！</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=653919">博通将为谷歌供应TPU芯片、为Anthropic提供算力，股价盘后涨3%</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=653918">Anthropic年化收入已超过300亿美元 部署约3.5吉瓦AI算力</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=653696">Anthropic试图挽救泄露源代码，却“误删”数千GitHub仓库</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=653257">Anthropic史上最强AI模型曝光，美国网安概念股全线暴跌</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=653102">Anthropic起诉白宫迎阶段性胜利：政府涉嫌违宪，Claude禁令被叫停</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=653100">与OpenAI抢上市 Anthropic最快10月IPO已接洽投行</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=652804">Anthropic有望解除封禁令？美法官：政府似乎在报复</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=652406">黄仁勋回应Anthropic与美军方争执：科技领袖不要制造AI恐慌</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=652151">特朗普政府反击Anthropic诉讼 司法部：AI条款无法接受 已难以信赖</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=651470">Claude协助美军轰炸伊朗小学？马斯克：Anthropic最虚伪</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=651401">微软表态支持Anthropic 要求法院暂停国防部“供应链风险”指定</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=651149">与Anthropic闹翻后 美政府收紧AI合同：模型必须可用于任何合法用途</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=651049">奥特曼暗讽Anthropic：政府权力本应比私营公司大</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=650950">Anthropic CEO炮轰奥特曼：全是谎言，与军方一起作秀</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=650892">奥特曼告诫员工：OpenAI无法左右美军方决策 Anthropic是前车之鉴</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=650744">美国财政部等部门开始全面停用Anthropic 改用OpenAI</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=650643">美媒揭秘美国军方与第二大AI公司Anthropic“撕破脸”内幕</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=649144"> AI公司Anthropic融资目标翻倍至200亿美元，估值有望冲上3500亿美元</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=648534">Anthropic及谷歌DeepMind CEO：AI已开始取代公司内部的初级职位</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=648364">美国软件股开年暴跌！“无所不能”的Claude开始抢生意？</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=647929">消息称Anthropic及OpenAI的AI爬虫“蚕食”互联网 内容网站被“吸血”后回报寥寥</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=644643">Claude AI的“价值观”排序首次公开：安全第一，帮助用户排第四</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=643872">Anthropic发布模型Opus 4.5，称其编程能力已超越人类工程师</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=642887">Anthropic宣布向AI基建投资500亿美元 “筑墙”迎战OpenAI</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=641119">Claude 看齐 ChatGPT 新增 AI 自动记忆，能记住你的每一次对话</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=641042">谷歌AI芯片获大单：Anthropic将使用100万个TPU训练大模型</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=640841">数百亿美元量级，曝Anthropic与谷歌正就大型云算力交易接触</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=640784">最高百亿美元！谷歌与Anthropic洽谈云计算协议，Alphabet盘后上涨</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=638177">Claude公司CEO示警称AI加速取代人类，近半白领岗位未来5年恐被淘汰</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=636480">投后估值增至1830亿美元，AI企业Anthropic完成130亿美元F轮融资</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=630522">为训练AI模型，Anthropic耗资数百万美元购入并“销毁”巨量图书</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=626773">全球最强编程模型Claude 4发布！自动写代码的时代来了</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=622063">叫板OpenAI！Anthropic推出200美元Claude聊天机器人订阅套餐</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=620013">Anthropic AI聊天机器人Claude新增联网搜索功能</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=619110">Anthropic CEO阿莫代伊：未来AI或有自我决定权，可拒绝“不爽”的任务</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=617504">Anthropic 全面开放 Claude AI 的 GitHub 集成，赋能所有开发者</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=617376">AI 模型 Claude 3.7 Sonnet 训练成本曝光：仅数千万美元</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=615876">Anthropic发布首份AI经济指数报告：软件工程师、作家成AI应用先锋</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=615337">亚马逊2月26日发布新一代Alexa生成式AI服务，使用Claude模型</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=611943">谷歌被曝正使用Anthropic的Claude模型来改进其Gemini AI</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=604938">继ChatGPT后，Anthropic旗下Claude AI推出桌面平台客户端</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=594182">安卓版Claude应用上线：打造值得信赖的AI助手，可总结内容、生成文本等</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=591249">GPT-4o不香了？OpenAI竞争对手Anthropic发布最强大AI模型Claude 3.5</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=591241">“力压GPT-4o和Gemini 1.5 Pro”，Anthropic推出Claude 3.5 Sonnet AI模型</a><br />
		<a href="https://wap.ikanchai.com/?action=show&amp;contentid=567581">“逼宫者”已超700人，消息称OpenAI正在就合并事宜与Anthropic接洽</a><br />
		</p>
<p><anchor title="返回"><prev/>&lt;返回</anchor><br /><br /><a href="https://wap.ikanchai.com/" title="返回首页">&lt;返回首页</a></p>
<p align="center">Copyright CmsTop.com<br />2026年04月15日 01:37:17</p></card>
</wml>