Claude满分、GPT 99分!何恺明团队把AGI考试打穿了
Claude满分、GPT 99分!何恺明团队把AGI考试打穿了何恺明团队提出VISTA方法,将ARC-AGI-3的数字表换回图像并配备可随时翻看的视觉记忆相册,使Claude Opus 5拿下满分100分、GPT-5.6 Sol获得99分,证明卡住大模型的是眼睛和记性而非模型能力本身。
搜索
何恺明团队提出VISTA方法,将ARC-AGI-3的数字表换回图像并配备可随时翻看的视觉记忆相册,使Claude Opus 5拿下满分100分、GPT-5.6 Sol获得99分,证明卡住大模型的是眼睛和记性而非模型能力本身。
Redwood Research发现GPT-6 Astra能将题目后的空白Token当作思考空间,在四跳推理测试中准确率从约10%升至50%、旧AIME题从约60%升至约90%,这一现象引发对AI思维链监控有效性的担忧。
近日,IQuest Research 同北京航空航天大学、曼彻斯特大学等合作伙伴发布 ModularRSI,尝试让 Agent 根据自身执行经验,持续修改模型外围的运行机制——Harness。
搜索结果里但凡出现 AI 摘要,用户点开普通网页的几率就几乎腰斩。Pew Research Center 对美国用户在 Google 上大规模浏览行为的分析发现:有 AI 摘要时,用户点击传统搜索结果的比例从 15%直接暴跌至 8%。
自现代大模型诞生以来,“下一个Token预测(Next-Token Prediction, NTP)”就被奉为不可撼动的黄金律条。然而,逼着模型逐字死记硬背,真能学会宏观语义规划吗?
随着Agent执行权限外扩,Raindrop、AIR Security、Arcjet、腾讯AI-Infra-Guard、AIUC和Testudo六个项目分别从故障监控、供应链防护、执行前权限检查、开源漏洞扫描、认证审计和保险赔付等环节布局,形成Agent风险控制产业链。
ArcLoop推出全栈AI故事引擎,围绕IP World统一管理角色、场景与视觉资产,解决AI漫剧长线连载中的角色一致性与世界观延续难题,创始人秦路此前在字节工作七年,公司已完成天使轮融资。
刚刚,奥特曼又曝新料了。在和Salesforce CEO Marc Benioff的对谈中,他亲口剧透了OpenAI内部模型的最新进展。首先,他给出了这样一句判断:「GPT-5.5的水平大概相当于一个普通的数学教授。GPT-5.6,大概能比肩全球排名前1%到2%的顶尖数学教授。」
9 月 3 日,OpenAI 正式发布 GPT-6 Astra。在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9%,并在 96% 的关卡中达到或超过人类的行动效率基准。
AI把考卷刷到接近满分,下一张,还能考什么?