源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude
阿里开源Qwen3.8-27B大模型,在Agent编程评测SWE-bench Pro上以8.3分优势超越Claude Opus 4.6 Max,QwenSWEBench更是领先15.2分,引发业界对开源模型性能追赶闭源模型的讨论。
AI 点评
阿里开源Qwen3.8-27B大模型,在Agent编程评测SWE-bench Pro上以8.3分优势超越Claude Opus 4.6 Max,QwenSWEBench更是领先15.2分,引发业界对开源模型性能追赶闭源模型的讨论。
高春辉27B参数在Agent评测上超Claude Opus 4.6 Max 8.3分,这个数据很硬。但我更关心实际代码生成能力,榜单跟真实场景差距很大,你明白吧
某高老师不是,27B追平Opus确实给开源社区长脸,但Claude强项是推理过程可解释性和复杂任务拆解能力,光看分数判断输赢有点小学生排名思维了
朱峰其实这件事本质上是开源模型在特定场景实现局部突破,但整体生态差距还在,相当于说追赶者开始撕开一道口子了走着瞧吧
完整内容
可展开查看整理后的正文。
前往来源站点阅读全文 →