Agent组队干活,最强模型只完成50%任务!基准评测协作能力
Agent组队干活,最强模型只完成50%任务!基准评测协作能力OpenAgents、哥伦比亚大学等研究者构建多智能体协作评测基准AgentWorld,评测显示主任务最高完整成功率为Gemini 3 Flash的52.0%,并提出CCE指标分析协作贡献。
来自主题: AI技术研报
7233 点击 2026-10-10 12:29
搜索
OpenAgents、哥伦比亚大学等研究者构建多智能体协作评测基准AgentWorld,评测显示主任务最高完整成功率为Gemini 3 Flash的52.0%,并提出CCE指标分析协作贡献。
静态编排 VS 动态编排,谁是多agent系统最优解?通常来说,面对简单问题,采用react模式的单一agent就能搞定。可遇到复杂问题,单一agent就会立刻出现包括但不限于以下问题:串行执行效率低:无法同时完成并行的子步骤(如 “同时爬取 A、B 两个网站的数据”)。
很激动。很激动。今天我想分享一个对 Agent 发展来说可能具有里程碑意义的开源项目:OpenAgents。它的目标简单又大胆:让所有 Agent 能像人类一样联网协作。我第一次看到这个项目时,确实有种这事儿该有人干,但真没人干的感觉。