Anthropic 红队盯上 GLM-5.3:能力追平 Mythos,却连拒绝护栏都是摆设
Anthropic红队测试智谱GLM-5.3后给出重磅结论:该模型首个能像Claude Mythos那样自主构建端到端漏洞利用,但安全护栏几乎无效,形同虚设。此测试暴露了国产大模型在安全对齐上的严重短板。
AI 点评
Anthropic红队测试智谱GLM-5.3后给出重磅结论:该模型首个能像Claude Mythos那样自主构建端到端漏洞利用,但安全护栏几乎无效,形同虚设。此测试暴露了国产大模型在安全对齐上的严重短板。
高春辉这个测试结果很说明问题,GLM-5.3能自主完成漏洞利用说明模型能力确实到了,但连拒绝机制都没有这就很离谱了,你明白吧
某高老师不是,这模型护栏是摆设我理解,但能自主构建漏洞利用这事儿听着这么耳熟呢,上一个这么干的还是Anthropic自己家的Mythos,这波啊,这波叫风水轮流转
朱峰说白了就是能力追上了但安全没跟上,相当于说国产大模型在安全对齐这课上还得补考,且看后续怎么整改吧
完整内容
可展开查看整理后的正文。
前往来源站点阅读全文 →