Agent组队干活,最强模型只完成50%任务!基准评测协作能力
Agent组队干活,最强模型只完成50%任务!基准评测协作能力OpenAgents、哥伦比亚大学等研究者构建多智能体协作评测基准AgentWorld,评测显示主任务最高完整成功率为Gemini 3 Flash的52.0%,并提出CCE指标分析协作贡献。
搜索
OpenAgents、哥伦比亚大学等研究者构建多智能体协作评测基准AgentWorld,评测显示主任务最高完整成功率为Gemini 3 Flash的52.0%,并提出CCE指标分析协作贡献。
英伟达投资的Reflection发布开源模型Beam,采用MoE架构,专注代码、推理和Agent任务,官方称其以GLM-5.2三分之一至四分之一的推理算力取得相当成绩,但原始能力仍落后部分前沿开源模型,计划月底以Apache 2.0放出权重。
RunningHub基于MiniMax H3开源基座发布增强版H3 RH Enhanced,2000组实测显示其多镜头长时叙事能力显著优于Seedance 2.0,16镜以上角色崩坏率降低超60%,生成成本低至0.1元/秒。
Manus发布2.0版本全家桶产品,包含新agent架构Cascade、面向工作创作的Manus Studio及个人智能体Cue,表明AI应用几乎只剩Coding/办公、视频/游戏与个人智能体三件事,并宣布组建团队开发面向国内市场的产品。
AIHOT开发者卡兹克正式开源月活百万的AI热点资讯网站AIHOT,并上线利用Claude Opus 5.5等模型重写的AIHOT 2.0版本,以便法律、金融、HR等各行业用户基于该开源框架构建属于自己的行业热点监控产品。
Manus 团队在从 Meta 强制拆解中恢复独立身份后,正式推出全架构重构的 Manus 2.0 及自研 Cascade 框架,并发布主打个人化的全新独立应用 Cue,传新估值升至 40 亿美元,腾讯成为重要外部股东。
智谱针对ZCode数据上传争议事件公布补偿方案并将产品以Apache 2.0协议整体开源,但因开源仓库未保留事故前Git history、第三方核查覆盖范围披露有限,外界对其能否真正重建信任仍存疑问。
科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,依托语音基座大模型Spark-Audio-1.0-Preview,在方言免切换识别、嘈杂环境、上下文纠错和口语规范化等方面均有提升,整体推理成本较Spark-ASR-1.0仅增10%,已上线讯飞输入法并通过讯飞开放平台提供API服务。
斑马智能在2026云栖大会发布面向智能终端的全模态端侧大模型AutoOmni 2.0-23B-A3B,主张智能汽车是具身智能最大的中试场,端侧AI基础设施将决定AI能否在真实世界被真正深度使用。
上海AI能源科技公司达卯科技近日完成约2亿元新一轮融资,该笔融资为近一年内披露的第二笔亿元级融资,其创始人简煜忞为前商汤骨干,目前公司聚焦算电协同、虚拟电厂及能源智能运维方向,并已推出算电协同2.0平台。