AI技术研报-这里有最前沿的人工智能技术解读

首个超越GPT4o级开源模型！Llama 3.1泄密：4050亿参数，下载链接、模型卡都有了

Llama 3.1 终于现身了，不过出处却不是 Meta 官方。

来自主题: AI技术研报

6317 点击 2024-07-23 16:15

电脑平板组AI集群，在家就能跑400B大模型，GitHub狂揽2.5K星

不用H100，三台苹果电脑就能带动400B大模型。背后的功臣，是GitHub上的一个开源分布式AI推理框架，已经斩获了2.5k星标。

来自主题: AI技术研报

9219 点击 2024-07-23 00:26

“具身智能小镇”来了！机器人逛超市买菜满街跑，AI充当NPC，来自上海AI Lab

超逼真的机器人小镇来了！在这里，机器人可以像人一样在超市里购物

来自主题: AI技术研报

8769 点击 2024-07-23 00:23

挑战Scaling Law，Meta发布移动端350M小模型MobileLLM，性能比肩7B LLaMA-v2

Scaling Law还没走到尽头，「小模型」逐渐成为科技巨头们的追赶趋势。Meta最近发布的MobileLLM系列，规模甚至降低到了1B以下，两个版本分别只有125M和350M参数，但却实现了比更大规模模型更优的性能。

来自主题: AI技术研报

10743 点击 2024-07-22 15:25

ECCV 2024 | 提升GPT-4V、Gemini检测任务性能，你需要这种提示范式

多模态大模型（Multimodal Large Language Models，MLLMs）在不同的任务中表现出了令人印象深刻的能力，尽管如此，这些模型在检测任务中的潜力仍被低估。

来自主题: AI技术研报

11685 点击 2024-07-22 14:58

中科大联合华为诺亚提出Entropy Law，揭秘大模型性能、数据压缩率以及训练损失关系

数据是大语言模型（LLMs）成功的基石，但并非所有数据都有益于模型学习。

来自主题: AI技术研报

10511 点击 2024-07-22 14:55

从空间智能到具身智能，跨维践行Sim2Real AI最高效路径

具身智能狂潮降临的一年多里，物理世界与信息的生产与交互方式发生着革命性变化。

来自主题: AI技术研报

12863 点击 2024-07-22 14:47

AI视频修复速度10倍提升，过曝变色也能逐帧搞定｜美图国科大新算法

家人们，消除“视频闪烁”（比如画面突然一白）有新招了！

来自主题: AI技术研报

11955 点击 2024-07-21 17:16

ECCV 2024 | 让GPT-4图像理解更易出错，全新策略增强VLP模型对抗迁移性

针对视觉-语言预训练（Vision-Language Pretraining, VLP）模型的对抗攻击，现有的研究往往仅关注对抗轨迹中对抗样本周围的多样性，但这些对抗样本高度依赖于代理模型生成，存在代理模型过拟合的风险。

来自主题: AI技术研报

10913 点击 2024-07-21 17:12

在机器人顶会 RSS 2024 上，中国的人形机器人研究斩获最佳论文奖

近日，机器人领域著名会议 RSS（Robotics: Science and Systems） 2024 在荷兰代尔夫特理工大学圆满落幕。

来自主题: AI技术研报

9546 点击 2024-07-21 17:07

打破生态孤岛，国产异构原生AI算力工具问世，来自中科加禾

「通过系统优化软件的帮助，开发的门槛会被降低，各种不同硬件会得到统一，让技术生态得到发展。

来自主题: AI技术研报

9587 点击 2024-07-21 17:03

前谷歌科学家Yi Tay「LLM演义」系列博客第一弹：BERT为何匿迹江湖？

前谷歌科学家Yi Tay重磅推出「LLM时代的模型架构」系列博客，首篇博文的话题关于：基于encoder-only架构的BERT是如何被基于encoder-decoder架构的T5所取代的，分析了BERT灭绝的始末以及不同架构模型的优缺点，以史为鉴，对于未来的创新具有重要意义。

来自主题: AI技术研报

11110 点击 2024-07-21 16:58

斯坦福博士图解AlphaFold 3：超多细节+可视化还原ML工程师眼中的AF3

AlphaFold 3的论文太晦涩？没关系，斯坦福大学的两位博士生「图解」AlphaFold 3 ，将模型架构可视化，同时不遗漏任何一个细节。

来自主题: AI技术研报

10496 点击 2024-07-21 16:53

OpenAI掀小模型血战！苹果DCLM强势登场，碾压Mistral 7B全开源

小模型时代来了？OpenAI带着GPT-4o mini首次入局小模型战场，Mistral AI、HuggingFace本周接连发布了小模型。如今，苹果也发布了70亿参数小模型DCLM，性能碾压Mistral-7B。

来自主题: AI技术研报

10393 点击 2024-07-21 16:46

KDD 2024｜港大黄超团队深度解析大模型在图机器学习领域的「未知边界」

在信息爆炸的当今时代，我们如何从浩如烟海的数据中探寻深层次的联系呢？

来自主题: AI技术研报

10947 点击 2024-07-21 14:21

权重、代码、数据集全开源，性能超越Mistral-7B，苹果小模型来了

小模型成趋势？

来自主题: AI技术研报

11336 点击 2024-07-21 14:19

机器人版的「斯坦福小镇」来了，专为具身智能研究打造

首个专为各种机器人设计的模拟互动 3D 社会。

来自主题: AI技术研报

11150 点击 2024-07-21 14:17

使用视觉语言模型进行 PDF 检索 [译]

近年来，随着大语言模型 (LLM) 的发展，构建检索增强生成 (RAG) 解决方案成为了一个热门话题。RAG 将 LLM 的强大功能与检索模型结合，应用于专有知识数据库。然而，对于开发人员来说，一个主要挑战是将各种文档格式（如 PDF、HTML 等）转换为可供文本模型处理的格式。

来自主题: AI技术研报

10560 点击 2024-07-21 14:12

LoRA综述来了! 浙大《大语言模型的LoRA研究》综述

低秩适应（Low-Rank Adaptation，LoRA）通过可插拔的低秩矩阵更新密集神经网络层，是当前参数高效微调范式中表现最佳的方法之一。此外，它在跨任务泛化和隐私保护方面具有显著优势。

来自主题: AI技术研报

12444 点击 2024-07-21 14:02

英伟达Mistral AI联袂出击！120亿小模型王者强势登场，碾压Llama 3单张4090可跑

GPT-4o mini头把交椅还未坐热，Mistral AI联手英伟达发布12B参数小模型Mistral Nemo，性能赶超Gemma 2 9B和Llama 3 8B。

来自主题: AI技术研报

8133 点击 2024-07-21 00:16

大模型“自学”后能力反下降，Llama/Mistral都没逃过

AI经过多轮“自我提升”，能力不增反降？

来自主题: AI技术研报

9196 点击 2024-07-19 17:04

从LLM到AI Agent，从Workflow到Agentic Workflow，25篇论文全面了解智能体工作流

著名AI学者、斯坦福大学教授吴恩达提出了AI Agent的四种设计方式后，Agentic Workflow（智能体工作流）立即火爆全球，多个行业都在实践智能体工作流的应用，并推动了新的Agentic AI探索热潮。

来自主题: AI技术研报

11204 点击 2024-07-19 16:34

LLama+Mistral+…+Yi=? 免训练异构大模型集成学习框架DeePEn来了

随着大语言模型展现出惊人的语言智能，各大 AI 公司纷纷推出自己的大模型。这些大模型通常在不同领域和任务上各有所长，如何将它们集成起来以挖掘其互补潜力，成为了 AI 研究的前沿课题。

来自主题: AI技术研报

9677 点击 2024-07-19 16:21

华为GTS LocMoE+：高可扩展性亲和度 MoE 架构，低开销实现主动路由

MoE 因其在训推流程中低销高效的特点，近两年在大语言模型领域大放异彩。作为 MoE 的灵魂，专家如何能够发挥出最大的学习潜能，相关的研究与讨论层出不穷。此前，华为 GTS AI 计算 Lab 的研究团队提出了 LocMoE ，包括新颖的路由网络结构、辅助降低通信开销的本地性 loss 等，引发了广泛关注。

来自主题: AI技术研报

6161 点击 2024-07-19 16:16

假开源真噱头？Meta再陷「开源」争议，LeCun被炮轰Meta只是开放模型

大模型开源的热潮下，隐藏着诸多问题，从定义的模糊到实际开放内容的局限性，Lecun再陷Meta大模型是否真开源的质疑风波只是冰山一角。

来自主题: AI技术研报

9738 点击 2024-07-19 12:34

清华提出时间序列大模型：面向通用时序分析的生成式Transformer | ICML 2024

大模型在语言、图像领域取得了巨大成功，时间序列作为多个行业的重要数据类型，时序领域的大模型构建尚处于起步阶段。近期，清华大学的研究团队基于Transformer在大规模时间序列上进行生成式预训练，获得了任务通用的时序分析模型，展现出大模型特有的泛化性与可扩展性

来自主题: AI技术研报

12067 点击 2024-07-19 12:31

如何将 LLM 的上下文扩展至百万级？

在2023年初，即便是当时最先进的GPT-3.5，其上下文长度也仅限于2k。然而，时至今日，1M的上下文长度已经成为衡量模型技术先进性的重要标志之一。

来自主题: AI技术研报

6628 点击 2024-07-19 10:14

AI Agent 阶段性总结与创投观察

Agent 是什么

来自主题: AI技术研报

12049 点击 2024-07-18 17:35

专治大模型“刷题”！贾佳亚团队新基准让模型只挑错不做题，GPT-4得分不到50

大模型测试能拿高分，实际场景中却表现不佳的问题有解了。

来自主题: AI技术研报

11408 点击 2024-07-18 17:21

只激活3.8B参数，性能比肩同款7B模型！训练微调都能用，来自微软

只需激活60%的参数，就能实现与全激活稠密模型相当的性能。

来自主题: AI技术研报

10437 点击 2024-07-18 16:44

AI技术研报-这里有最前沿的人工智能技术解读

首个超越GPT4o级开源模型！Llama 3.1泄密：4050亿参数，下载链接、模型卡都有了

电脑平板组AI集群，在家就能跑400B大模型，GitHub狂揽2.5K星​

“具身智能小镇”来了！机器人逛超市买菜满街跑，AI充当NPC，来自上海AI Lab

挑战Scaling Law，Meta发布移动端350M小模型MobileLLM，性能比肩7B LLaMA-v2

ECCV 2024 | 提升GPT-4V、Gemini检测任务性能，你需要这种提示范式

中科大联合华为诺亚提出Entropy Law，揭秘大模型性能、数据压缩率以及训练损失关系

从空间智能到具身智能，跨维践行Sim2Real AI最高效路径

AI视频修复速度10倍提升，过曝变色也能逐帧搞定｜美图国科大新算法

ECCV 2024 | 让GPT-4图像理解更易出错，全新策略增强VLP模型对抗迁移性

在机器人顶会 RSS 2024 上，中国的人形机器人研究斩获最佳论文奖

打破生态孤岛，国产异构原生AI算力工具问世，来自中科加禾

前谷歌科学家Yi Tay「LLM演义」系列博客第一弹：BERT为何匿迹江湖？

斯坦福博士图解AlphaFold 3：超多细节+可视化还原ML工程师眼中的AF3

OpenAI掀小模型血战！苹果DCLM强势登场，碾压Mistral 7B全开源

KDD 2024｜港大黄超团队深度解析大模型在图机器学习领域的「未知边界」

权重、代码、数据集全开源，性能超越Mistral-7B，苹果小模型来了

机器人版的「斯坦福小镇」来了，专为具身智能研究打造

使用视觉语言模型进行 PDF 检索 [译]

LoRA综述来了! 浙大《大语言模型的LoRA研究》综述

英伟达Mistral AI联袂出击！120亿小模型王者强势登场，碾压Llama 3单张4090可跑

大模型“自学”后能力反下降，Llama/Mistral都没逃过

从LLM到AI Agent，从Workflow到Agentic Workflow，25篇论文全面了解智能体工作流

LLama+Mistral+…+Yi=? 免训练异构大模型集成学习框架DeePEn来了

华为GTS LocMoE+：高可扩展性亲和度 MoE 架构，低开销实现主动路由

假开源真噱头？Meta再陷「开源」争议，LeCun被炮轰Meta只是开放模型

清华提出时间序列大模型：面向通用时序分析的生成式Transformer | ICML 2024

如何将 LLM 的上下文扩展至百万级？

AI Agent 阶段性总结与创投观察

专治大模型“刷题”！贾佳亚团队新基准让模型只挑错不做题，GPT-4得分不到50

只激活3.8B参数，性能比肩同款7B模型！训练微调都能用，来自微软

电脑平板组AI集群，在家就能跑400B大模型，GitHub狂揽2.5K星