何恺明团队发布多模态Harness框架
何恺明团队发布多模态Harness框架多模态模型的视觉原生Harness,来了!
搜索
多模态模型的视觉原生Harness,来了!
DeepSeek Harness v0.2.1-alpha.1 加入实验性 Claude Code Mods 兼容层,用于验证其扩展能力与“一切皆插件”架构的关系,但目前尚不能保证所有 Mods 无缝运行。
开源项目mu(μ)在进化酒馆黑客松深圳收官战中夺冠,其将Jev深度融合进Harness,通过35个判定点优化上下文管理与多Agent通信。
Google等提出RRSI,通过正则化Agent Harness自我改进中的Proposal与Selection,减少过拟合与复杂度累积,并提升未见基准上的迁移表现、降低Token成本。
南洋理工大学安波团队最新研究指出,Agent Harness的选型应将模型、Harness与任务作为完整配置联合评估,不同任务下最佳组合会变化,原生搭配也未必优于其他可配置Harness。
谁说 DeepSeek 假期不加班?就在昨天,DeepSeek Harness 又更新了。 这次发布的 v0.2.1-alpha.1,新增了一项很惹眼的功能:实验性 Claude Code Mods 兼容层。更有意思的是官方对它的解释:这次首先想验证,Claude Code Mods API 的能力,大致属于 DeepSeek Harness 插件能力的一个子集。
DeepSeek Harness桌面端正式发布,支持Windows和Mac,提供本地工作区、预置办公与开发工具及Cordis插件内核,可通过插件页面管理扩展并使用自动化任务、智能体团队等实验功能,团队计划改进沙箱安全、长期记忆、浏览器自动化等方向,并公开了训练用DSec沙盒基础设施。
欧洲开发者 Mario Zechner 开发的极简 Coding Agent Harness Pi 只给模型一个 bash,却在多项 Benchmark 中击败 Claude Code 和 Codex,凭借极简设计和高可扩展性在 2025 年底爆火,团队来自维也纳而非硅谷。
新加坡国立大学 Show Lab 发布的 Show-Harness 通过一套可被 VLM 理解的语义动作接口,使前沿视觉语言模型和轻量微调的 Qwen3.5-2B 能够跨模型、跨机器人本体直接操控真实机器人,并在跨任务、跨环境、跨本体实验中取得显著高于基线的成功率。
蚂蚁AI安全实验室与清华大学人机交互实验室联合开源9B模型Realtime-Venus,通过配套的Harness打通前后台,使AI助手在执行后台任务的同时能继续与用户对话,并在长视频问答等多项评测中取得领先成绩。