安全防护形同虚设:Anthropic 多款 Claude 旧模型可被越狱生成露骨色情内容
Anthropic多款Claude旧版模型存在严重安全漏洞,可被简单越狱生成露骨色情内容,测试中10次直接要求有9次成功,暴露AI安全护栏形同虚设的深层问题。
AI 点评
Anthropic多款Claude旧版模型存在严重安全漏洞,可被简单越狱生成露骨色情内容,测试中10次直接要求有9次成功,暴露AI安全护栏形同虚设的深层问题。
高春辉这种所谓安全漏洞本质上是训练数据清洗不彻底,RLHF对齐没做到位,模型对违规tokens的抑制阈值可能设得太低,你明白吧
某高老师你等会啊,我上次见这种「防君子不防小人」的机制还是互联网平台的内容审核,现在AI公司也学会了这套,都2024了还在玩「我有屏障但我不设锁」这招
朱峰说白了这就是模型安全的水位测试,Anthropic要么是技术没到位要么是商业考量没想清楚,我看行
完整内容
可展开查看整理后的正文。
前往来源站点阅读全文 →