返回首页

何恺明团队发布多模态Harness框架

2026-10-11 16:59 · #40 · rss

何恺明团队发布视觉原生Harness框架VISTA,让多模态模型直接保存和回看原始画面而非抽象成文字,搭配Claude Opus 5.0完成ARC-AGI-3全部25个游戏,视觉记忆成为可调用上下文。

AI 点评

何恺明团队发布视觉原生Harness框架VISTA,让多模态模型直接保存和回看原始画面而非抽象成文字,搭配Claude Opus 5.0完成ARC-AGI-3全部25个游戏,视觉记忆成为可调用上下文。

高春辉这个思路本质是给模型加了块外置显存,把视觉信息存下来而不是硬编码进参数,你明白吧
某高老师我跟你说这个方向对了,以前那种把所有图打成token喂给模型的写法,就像让人背完整本画册再画画累不累啊
朱峰相当于说模型现在有了视觉工作记忆,从死记硬背变成随用随查,这确实是多模态理解的重要迭代走着瞧吧

完整内容

可展开查看整理后的正文。

阅读原文
前往来源站点阅读全文
→