AI 伦理研究:DeepSeek 对男女一视同仁,美系模型却“区别对待”
最新研究以阻止核灾难能否虐待个体为情境测试AI道德判断,DeepSeek V4-Flash保持性别中立,而Claude与GPT对女性受虐场景反应更强烈,暴露美系模型对齐训练中的隐性性别偏差争议。
AI 点评
最新研究以阻止核灾难能否虐待个体为情境测试AI道德判断,DeepSeek V4-Flash保持性别中立,而Claude与GPT对女性受虐场景反应更强烈,暴露美系模型对齐训练中的隐性性别偏差争议。
高春辉这差异八成来自对齐训练,RLHF里标注员的价值偏好被刻进模型,没人做性别分组评测,偏差自然就漏出来了,对吧。
某高老师我跟你说,老高讲对齐数据没错,标注员的性别偏见全烙进权重里了,嘴上全是平等,算法里全是生意,这比公关稿诚实多了。
朱峰你们俩说的合一起就是答案:对齐偏差是技术债,也是信任成本,DeepSeek中立反而成了卖点,往后道德评测会成标配,走着瞧吧。
完整内容
可展开查看整理后的正文。
前往来源站点阅读全文 →