AI资讯新闻榜单内容搜索-Mark

本周 AI 项目推荐：UXBench、MemLens、RoadmapBench…下一代模型，需要下一代 Benchmark

我们最近在重新思考一件事：到底什么样的 Benchmark，才值得今天继续做？

来自主题: AI资讯

5773 点击 2026-06-22 09:37

从v0.7开始，我先给 Humanize PPT 划了一条边界。把渲染PPT页面外包给下游的Skill。Humanize PPT负责把大纲，逐页意图，视频和图片素材的坑位和演讲稿，整理成结构化的 JSON 与 Markdown，再交给下游 Skill 原生渲染。

来自主题: AI资讯

8309 点击 2026-06-20 14:12

这是葬AI起号以来工作量最大的一篇文章。为了严肃评测国产模型的能力，我自研了一个Benchmark，完整测试了智谱、Qwen、Kimi、Minimax、Deepseek这些最新国产模型，还引入了境外势力Claude作对照组。

来自主题: AI资讯

8126 点击 2026-06-17 13:30

今年开年以来，不管是硅谷、还是国内的 AI 投资圈子，都不太敢投 AI 应用了。

来自主题: AI资讯

8623 点击 2026-06-12 10:14

根据我长期使用的观察，0.3 倍率说是用 Kiro 逆向出来的 Claude，2.0 倍率说是正经 Claude Max 号池接出来的。听起来后者肯定更靠谱。我一开始也这么想的。毕竟倍率差了快七倍，价格摆在那，总不至于拿假货糊弄人吧。

来自主题: AI资讯

9422 点击 2026-06-11 16:53

之前预告过的那个「手机上的 Markdown / HTML 阅读器」做完了,叫即览。

来自主题: AI资讯

9140 点击 2026-06-09 14:06

近日，来自清华大学智能产业研究院（AIR）的团队联合北京智源研究院（BAAI）、北京大学、南京大学等机构构建了一个基准：GeoCodeBench。这是一个面向 3D 几何计算机视觉的 PhD 级 coding benchmark，

来自主题: AI技术研报

9135 点击 2026-06-07 10:54

2026 年初，国内具身智能赛道掀起了一波开源潮，越来越多团队开始公开自己的视觉-语言-动作（VLA）模型、数据集与训练框架。与此同时，行业竞争也逐渐集中到 benchmark 成绩、任务成功率以及跨任务泛化能力上，尤其是在标准化或已训练任务中的表现。

来自主题: AI技术研报

8314 点击 2026-05-29 09:19

“Claude 可能比你更擅长从你这里提取出你想要和需要的东西，而不是由你向 Claude 详细指定。”

来自主题: AI资讯

6351 点击 2026-05-25 09:50

Mechanize 发布了一项硬核测试：给前沿 AI coding agents 24 小时，用 Rust 从零写一个完整的 Game Boy Advance 模拟器，再和顶级开源模拟器 Mesen2 逐帧对比打分。

来自主题: AI技术研报

8086 点击 2026-05-18 16:48