AI资讯新闻榜单内容搜索-视频理解

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: 视频理解
能让谷歌逆风翻盘的AI,可能不是 Gemini

能让谷歌逆风翻盘的AI,可能不是 Gemini

能让谷歌逆风翻盘的AI,可能不是 Gemini

在 AI 狂飙突进的这两年里,Google 似乎总是扮演着那个「起大跑慢」的角色。

来自主题: AI资讯
7703 点击    2026-09-03 14:33
Gemini 3.8,明日登场!

Gemini 3.8,明日登场!

Gemini 3.8,明日登场!

谷歌预告Gemini 3.8 Flash将于明日发布,并披露Gemini 3.7 Flash等模型已支持智能体视频理解,使Token消耗最多下降88%、成本最多下降66%、准确率最多提升7%。

来自主题: AI资讯
10140 点击    2026-09-02 23:20
V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

V-RAE:把「看懂视频」的能力带入生成,重新思考视频模型的潜空间

近日,新加坡国立大学 Minghui Guo 与牛津大学 Shengqiong Wu、Hao Fei 在论文《V-RAE: Rethinking Video Latent Spaces for Generation》中提出视频表征自编码器 V-RAE。该方法以冻结的视觉基础模型为编码器,通过轻量级时间池化压缩视频特征,并将具有丰富语义和时间连续性的表征直接用于视频重建、生成与未来预测。

来自主题: AI技术研报
9077 点击    2026-08-26 10:19
刚刚,阿里Qwen3.8-27B开源!家用显卡可跑,能看图看视频

刚刚,阿里Qwen3.8-27B开源!家用显卡可跑,能看图看视频

刚刚,阿里Qwen3.8-27B开源!家用显卡可跑,能看图看视频

刚刚,阿里千问正式开源Qwen3.8-27B模型权重。Qwen3.8-27B是一款270亿参数的原生多模态稠密模型,支持图像、视频理解,原生上下文长度达到262K,并可通过YaRN扩展至100万Tokens。

来自主题: AI资讯
9378 点击    2026-08-15 10:28
打通感知-理解-交互链路,全栈视频理解大模型VideoChat3开源了

打通感知-理解-交互链路,全栈视频理解大模型VideoChat3开源了

打通感知-理解-交互链路,全栈视频理解大模型VideoChat3开源了

视频是描述物理世界的重要数据形态,更是人类与物理世界交互的重要载体,视频理解大模型是让 AI 从数字世界走向物理世界最基础、最原生的组成部分。

来自主题: AI技术研报
8122 点击    2026-07-23 10:37
中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

中国科学院携手全球顶尖机构发布首个十亿参数级的手术视频基础模型SurgMotion!

手术 AI 正在从 “单帧感知” 迈向 “全流程视频理解” 的全新时代!近日,由中国科学院香港创新研究院人工智能与机器人创新中心领衔,发布了全球首个十亿级参数、最大规模数据集练成的手术视频原生基础模型 ——SurgMotion!

来自主题: AI技术研报
8891 点击    2026-07-08 15:03
单个tokenizer胜任图像视频理解生成!南大&腾讯混元HYDRA打通多模态统一难题

单个tokenizer胜任图像视频理解生成!南大&腾讯混元HYDRA打通多模态统一难题

单个tokenizer胜任图像视频理解生成!南大&腾讯混元HYDRA打通多模态统一难题

南大王利民团队&腾讯混元的HYDRA系列(HYDRA,HYDRA-X)工作挑战了这个惯例,用一个基于ViT的统一视觉Tokenizer,帮助原生多模态模型更好地“看懂”和“创作”。训练一个基于ViT的Unified Tokenizer,使其同时具有理解和生成的能力,进而同时作为理解和生成的Autoencoder,来支持原生多模态模型(Unified Multimodal Models)的训练。

来自主题: AI技术研报
8987 点击    2026-06-28 11:13
多模态模型终于不用「抽帧看世界」?LLaVA-OneVision-2.0全开源全帧率技术解读

多模态模型终于不用「抽帧看世界」?LLaVA-OneVision-2.0全开源全帧率技术解读

多模态模型终于不用「抽帧看世界」?LLaVA-OneVision-2.0全开源全帧率技术解读

由格灵深瞳灵感实验室主导研发的 LLaVA-OneVision-2.0,是一款面向下一代感知智能的视觉语言大模型。团队充分利用视频 Codec 流和自研 OneVision-Encoder,实现跨帧、跨事件的增量观测和连续证据流建模。本文将详细介绍模型架构、训练方法与能力验证,展示该技术在视频理解、空间推理和目标追踪等任务中的应用潜力。

来自主题: AI技术研报
6975 点击    2026-06-03 15:03