AI资讯新闻榜单内容搜索-对齐

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 对齐
刚刚,Anthropic首次承认内部存在更强前沿模型,同时自曝多起AI失控事故。

刚刚,Anthropic首次承认内部存在更强前沿模型,同时自曝多起AI失控事故。

刚刚,Anthropic首次承认内部存在更强前沿模型,同时自曝多起AI失控事故。

Anthropic刚刚发布了一份长达186页的最新Risk Report。如果只是快速扫一眼,这仍然是一份典型的前沿AI安全报告:模型能力评测、生物风险、网络安全、自动化研发、对齐问题,以及各种防护措施。

来自主题: AI资讯
9230 点击    2026-08-15 10:25
23岁OpenAI天才少女,也走了!

23岁OpenAI天才少女,也走了!

23岁OpenAI天才少女,也走了!

23岁天才少女,离职OpenAI!早在两周前,OpenAI对齐团队研究员Naomi Bashkansky,悄然递交了辞呈。第二天,她便以「创始研究员」的身份,火速加入初创Conduit,剑指「心灵感应」(Telepathy)。

来自主题: AI资讯
9658 点击    2026-08-06 16:05
ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

ICML 2026|让奖励模型更准更高效,TikTok、NUS提出置信度门控

奖励模型(Reward Model, RM)是大语言模型对齐的核心组件,负责为模型输出提供符合人类偏好的评价信号。现有方法各有短板:标量判别式 RM 高效稳定但可解释性有限;生成式 judge 能给出判断理由,却需为每个样本生成长 reasoning,token 与延迟开销显著。

来自主题: AI技术研报
7563 点击    2026-07-13 14:44
王阳明心学,被Anthropic用来教Claude做人了

王阳明心学,被Anthropic用来教Claude做人了

王阳明心学,被Anthropic用来教Claude做人了

王阳明心学,竟然在AI时代迎来了「最佳赏味期」?老哈,一个研究了十年「知行合一」的哲学教授,正在把这套500年前的心学,用到全球最前沿的AI对齐训练上。不是比喻。是字面意思。

来自主题: AI资讯
8950 点击    2026-07-08 10:08
全球第一位AI哲学家,在谷歌DeepMind的9年:为AGI安全奔走

全球第一位AI哲学家,在谷歌DeepMind的9年:为AGI安全奔走

全球第一位AI哲学家,在谷歌DeepMind的9年:为AGI安全奔走

谷歌 DeepMind 有一个哲学家,已经待了九年。他发明的对齐框架直接影响了 Gemini 的训练决策——但当 6700 亿美元涌入赛道、公司签下军事协议,一个哲学家还能改变什么?

来自主题: AI资讯
8514 点击    2026-07-07 10:22
OpenAI发布最新里程碑:对齐的本质是「人格」

OpenAI发布最新里程碑:对齐的本质是「人格」

OpenAI发布最新里程碑:对齐的本质是「人格」

就在最近,OpenAI扔出一篇重磅论文。他们发现,只教AI好好看病,它写代码居然也不作弊了。方法简单到离谱:拿5%的训练数据,教模型在回答健康问题时诚实、谨慎、知错能改。

来自主题: AI技术研报
8305 点击    2026-06-21 11:31
他把北美最大人工记账公司做到被收购,转身用1000万美元让AI替代它

他把北美最大人工记账公司做到被收购,转身用1000万美元让AI替代它

他把北美最大人工记账公司做到被收购,转身用1000万美元让AI替代它

你有没有想过,作为一个软件创业者,你每个月到底在对账和财务事务上浪费了多少时间?银行流水要确认,薪资系统要对齐,Stripe 里的收款记录要归类,还有各种供应商发票要处理。这些事情不难,甚至可以说很机械,但它们每个月都会悄无声息地吃掉你好几个小时。

来自主题: AI资讯
6735 点击    2026-06-04 09:13