刚刚,OpenAI公开722个数学发现!霍奇猜想、黎曼zeta函数等手稿挤爆GitHub
刚刚,OpenAI公开722个数学发现!霍奇猜想、黎曼zeta函数等手稿挤爆GitHubOpenAI在GitHub的openai/math仓库公开722份数学手稿,涉及372个问题家族及Lean形式化证明,并表示多数结果来自未发布的内部模型,部分未形式化结果可能存在问题。
搜索
OpenAI在GitHub的openai/math仓库公开722份数学手稿,涉及372个问题家族及Lean形式化证明,并表示多数结果来自未发布的内部模型,部分未形式化结果可能存在问题。
开源项目mu(μ)在进化酒馆黑客松深圳收官战中夺冠,其将Jev深度融合进Harness,通过35个判定点优化上下文管理与多Agent通信。
清华团队开源以Qwen 3.8-27B为基础模型的VeriLoop E2,通过VGR外部证据门控实现可验证状态提交,并取得黎曼猜想临界线零点比例下界67.350003708785593%的严格有限维证书,但上游形式化桥接尚未完成。
StartLux发布完全开源的StartLux-Decision,其27B版本在Decision Index 0.2.1的38项基准中有31项超过Jev 1.13,并以63.88分升至公开榜首。
Rabbit创始人吕骋表示,人不该为Agent改变思考方式,OS3以持续对话、最多连接五台电脑并支持自带模型密钥和本地执行来降低门槛,但个人Agent的长期需求仍待验证。
在Anthropic冲刺IPO之际,Meta将Claude Code活跃用户从6万降至3万并转向Muse Code,微软也将内部Claude支出削减逾33%,单员工月度Token预算从10万美元降至1万美元。
Opus 5.5通过MV、3D游戏和机械沙虫等案例展示出编排完整创作流程的能力,文章指出爆款Demo正成为观察模型的新benchmark,但应结合时间、成本、工具与修改过程判断其成熟度。
今天,外网被这个视频刷屏了。有人用Fable 5.5一键生成了一部「人类数万年进化史」,把整个人类历史压缩进了3分钟。整个过程,都是用纯代码写出,零视频素材,零版权音乐,没有使用任何视频生成模型。
哈佛物理学家Matthew Schwartz用Claude和开源工具BootLoops处理可验证的科研任务,90天产出横跨18个学科的36篇论文初稿,并主张由人挑题、追问和验收,让AI发挥辅助而非替代科学家的作用。
VA-Bench测试12个主要多模态模型发现,Qwen3.8-max、Opus-5和GPT-5.6-sol虽在目标识别与定位上达100%、操作语义理解达99.6%—100%,完整任务成功率却仅为53.93%、52.86%和51.55%,暴露大模型从空间理解到执行与修正的断层。