我花了54个小时,做了一个可能更公平的AI大模型排行榜。
我花了54个小时,做了一个可能更公平的AI大模型排行榜。希望能做一个各个模型评分排行的汇总,方便实时了解和对比各种模型的性能。这个是一个非常有趣、且对我自己非常刚需的需求。因为现在的模型评测排行榜、评测集等等,实在是太多太多了,人人其实都可以做一份自己的评测集,然后来跑一份模型排行榜,有的测的全一些,有的就是个垂直场景的特定任务,这个量级真的特别大。
搜索
希望能做一个各个模型评分排行的汇总,方便实时了解和对比各种模型的性能。这个是一个非常有趣、且对我自己非常刚需的需求。因为现在的模型评测排行榜、评测集等等,实在是太多太多了,人人其实都可以做一份自己的评测集,然后来跑一份模型排行榜,有的测的全一些,有的就是个垂直场景的特定任务,这个量级真的特别大。
离开 OpenAI 不到一天,研究员 Andrew Ho 在 X 上写下一篇长文,质疑整个前沿 AI 实验室的商业模式。「前沿 AI 实验室赚的钱,或许根本撑不到 AGI 到来。」AI 圈知名播客主持人 Dwarkesh Patel 随后发文反驳:只要模型能力仍在快速增长,领先本身就能创造巨大的商业价值;一旦真正的 AGI 出现,它就会主动扩散。
在同一时期,另一支有中国大模型公司经历的团队也在做相似的事情。 这家公司叫Copula Lab,由两名前MiniMax核心成员创办,已经获得第一轮一线机构投资支持,目前对应千万美元级估值
今天,英国《金融时报》援引知情人士报道,字节跳动正在训练一个参数量高达10万亿的AI模型。而这一数字,在昨日晚间的晚点LatePost独家报道中还是“超5万亿”。即使是5万亿,这一模型的规模也已经超过目前中国已发布的最大模型Kimi K3,接近Anthropic的Fable 5;如果是10万亿,那字节的新模型规模将超越约有8万亿参数的Mythos 5。
7 月中旬的一天,清华科技园的一处办公区, 一台人形机器人站在屋子中央,身后没有风扇轰鸣的 GPU 机柜,不远处是两张落满公式的书写板。
天使轮由一线美元基金,智能制造与大模型产业方共同领投;数据集 Xperience-10M 位列全平台数据集榜第 2 名,具身赛道第一名,目前已被多款具身基础模型 Qwen-VLA、MolmoMotion 等采用;多模态采集系统 HOMIE 进入规模化量产交付,新一代系统将于 2026 年 8 月发布。
随着 AI 生图能力不断提升,如何让 AI 真正进入创作流程成为新的行业问题。兔展智能基于 UniWorld-Design 视觉 AI 大模型推出 RabbitVis,尝试推动视觉 AI 从图片生成走向可编辑、可交付的创作流程。
AI替代人的同时,也在创造新工作。FDE(前沿部署工程师),成为今年最火的AI新岗位。这个职位的任务是驻场在客户现场,解决AI落地的问题。那些靠帮企业落地大模型赚钱的公司,已经把它做成了业务标配。
一块 8.24GB 内存的 CPU,一个 2.78 万亿参数的大模型,甚至不需要显卡,Kimi K3 就这么水灵灵地跑起来了。
再牛的大模型,也要放到行业面前公开露个面,才算真交卷。