刚刚,OpenAI公开722个数学发现!霍奇猜想、黎曼zeta函数等手稿挤爆GitHub
刚刚,OpenAI公开722个数学发现!霍奇猜想、黎曼zeta函数等手稿挤爆GitHubOpenAI在GitHub的openai/math仓库公开722份数学手稿,涉及372个问题家族及Lean形式化证明,并表示多数结果来自未发布的内部模型,部分未形式化结果可能存在问题。
搜索
OpenAI在GitHub的openai/math仓库公开722份数学手稿,涉及372个问题家族及Lean形式化证明,并表示多数结果来自未发布的内部模型,部分未形式化结果可能存在问题。
英伟达投资的Reflection发布开源模型Beam,采用MoE架构,专注代码、推理和Agent任务,官方称其以GLM-5.2三分之一至四分之一的推理算力取得相当成绩,但原始能力仍落后部分前沿开源模型,计划月底以Apache 2.0放出权重。
清华团队开源以Qwen 3.8-27B为基础模型的VeriLoop E2,通过VGR外部证据门控实现可验证状态提交,并取得黎曼猜想临界线零点比例下界67.350003708785593%的严格有限维证书,但上游形式化桥接尚未完成。
Utopai Studios打造的Utopai X在Artificial Analysis Video Arena盲评中以1150 Elo位列全球第二,其核心竞争力是将模型深度集成PAI制作系统,并通过真实影视项目、专家反馈与系统迭代形成持续进化的数据飞轮。
StartLux发布完全开源的StartLux-Decision,其27B版本在Decision Index 0.2.1的38项基准中有31项超过Jev 1.13,并以63.88分升至公开榜首。
AI虚拟细胞(AIVC)正围绕基础模型、扰动数据、算力和评测标准展开竞赛,百图生科等机构加速布局,但纯AI尚不能稳定战胜统计基线,高质量扰动数据仍是瓶颈。
Rabbit创始人吕骋表示,人不该为Agent改变思考方式,OS3以持续对话、最多连接五台电脑并支持自带模型密钥和本地执行来降低门槛,但个人Agent的长期需求仍待验证。
Tavus发布全双工视频到视频交互模型Griffin,可实时生成720p数字人并理解停顿、表情与动作,在一分钟测试中让54名参与者近48%误以为在与人交谈,但该结果未独立验证且模型尚未公开。
《The Verge》报道,Mercor、Scale AI 和 Surge AI 招募律师、编剧、教师等专业人士生产 AI 训练数据,使劳动者在教 AI 取代原有工作的同时,面临项目骤停、严密监控、降薪和技能被模型掌握后需求消失的困境。
Google等提出RRSI,通过正则化Agent Harness自我改进中的Proposal与Selection,减少过拟合与复杂度累积,并提升未见基准上的迁移表现、降低Token成本。