AI资讯新闻榜单内容搜索-benchmark

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: benchmark
Opus 5.5凭什么刷屏一周,看完这些爆款案例我悟了

Opus 5.5凭什么刷屏一周,看完这些爆款案例我悟了

Opus 5.5凭什么刷屏一周,看完这些爆款案例我悟了

Opus 5.5通过MV、3D游戏和机械沙虫等案例展示出编排完整创作流程的能力,文章指出爆款Demo正成为观察模型的新benchmark,但应结合时间、成本、工具与修改过程判断其成熟度。

来自主题: AI资讯
10053 点击    2026-10-06 13:54
从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

从发现漏洞到判定作弊:BenchShield提出Reward Hacking检测新框架

BenchJack 之后,reward hacking 检测还缺什么? Agent 在 benchmark 上拿到高分,未必真正完成了任务。它也可能利用评测或奖励机制中的漏洞,绕开题目要求来提高得分。

来自主题: AI技术研报
7291 点击    2026-09-30 11:04
Pi 爆火真相 :为什么只给模型一个 bash,反而赢了 Claude Code 和 Codex

Pi 爆火真相 :为什么只给模型一个 bash,反而赢了 Claude Code 和 Codex

Pi 爆火真相 :为什么只给模型一个 bash,反而赢了 Claude Code 和 Codex

欧洲开发者 Mario Zechner 开发的极简 Coding Agent Harness Pi 只给模型一个 bash,却在多项 Benchmark 中击败 Claude Code 和 Codex,凭借极简设计和高可扩展性在 2025 年底爆火,团队来自维也纳而非硅谷。

来自主题: AI资讯
9345 点击    2026-09-29 11:16
BAI 资本成员企业 Humanlaya 完成数亿元 Pre-A 轮融资,AI 后训练进入“专家数据”时代

BAI 资本成员企业 Humanlaya 完成数亿元 Pre-A 轮融资,AI 后训练进入“专家数据”时代

BAI 资本成员企业 Humanlaya 完成数亿元 Pre-A 轮融资,AI 后训练进入“专家数据”时代

BAI资本成员企业Humanlaya(原壤智能)宣布完成由鼎晖香港基金领投的数亿元Pre-A轮融资,公司聚焦大模型后训练数据与评测,通过专家网络、高质量数据生产与Benchmark体系帮助模型提升在金融、法律、医疗等复杂专业任务中的能力。

来自主题: AI资讯
10312 点击    2026-09-24 10:09
千问办公押注的企业上下文,是 Agent 时代的组织语言

千问办公押注的企业上下文,是 Agent 时代的组织语言

千问办公押注的企业上下文,是 Agent 时代的组织语言

在大模型在拼命刷 Benchmark 卷编程的时候,「不能说话」的 Jev 却意外成了 AI 圈的新顶流,究其原因,大模型应用的价值正在从「生成什么」,进一步延伸到「能否理解复杂信息,并据此做出可靠判断」。

来自主题: AI资讯
7060 点击    2026-09-23 15:45
速递|AI个人助手Instinct寻求10亿美元融资,估值达100亿美元

速递|AI个人助手Instinct寻求10亿美元融资,估值达100亿美元

速递|AI个人助手Instinct寻求10亿美元融资,估值达100亿美元

AI个人助手Instinct正洽谈以约100亿美元的估值融资10亿美元,红杉资本、Benchmark和Coatue Management已就领投事宜进行洽谈,其用户数已增长至超过10万人。

来自主题: AI资讯
9992 点击    2026-09-20 11:08
OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

OpenAI把AI推向物理世界,这家公司已造好引擎,下一站1000万小时人类经验

9 月 3 日,OpenAI 正式发布 GPT-6 Astra。在 ARC-AGI-3(一个考验 AI 能否在陌生环境中自主探索、理解规则并规划行动的 Benchmark),Astra 拿下 99.9%,并在 96% 的关卡中达到或超过人类的行动效率基准。

来自主题: AI技术研报
9866 点击    2026-09-17 15:22
GPT-6登顶第一!AlphaFold之后最大震撼,成抗体预测最强AI

GPT-6登顶第一!AlphaFold之后最大震撼,成抗体预测最强AI

GPT-6登顶第一!AlphaFold之后最大震撼,成抗体预测最强AI

OpenAI发布的GPT-6 Astra在Insilico Medicine构建的DDD Benchmark抗体可开发性预测测试中以37.98分登顶第一,在不依赖外部专用工具的情况下击败所有前沿模型,标志着通用大模型正在突破抗体成药性预测这一生物医药研发的"死亡之谷",成为AlphaFold之后最具震撼性的科学范式转移。

来自主题: AI资讯
9327 点击    2026-09-11 16:06
OpenAI这是拿千禧年难题当Benchmark刷啊。。。

OpenAI这是拿千禧年难题当Benchmark刷啊。。。

OpenAI这是拿千禧年难题当Benchmark刷啊。。。

《纽约时报》最新追访,补出了这场冲突中此前没有披露的细节。

来自主题: AI资讯
8605 点击    2026-09-11 10:14