卷积

共 7 篇文章

CMU普林斯顿合力推出Mamba新架构,颠覆Transformer霸权,推理速度暴增5倍,解决致命bug

AIGC动态欢迎阅读原标题:颠覆Transformer霸权!CMU普林斯顿推出新架构Mamba,解决了致命bug并将推理速度提升5倍关键词:模型、序列、架构、卷积、研究人员文章来源:新智元内容字数:15024字内容摘要:新智元编辑报道:编辑部【新智元导读】CMU和普林斯顿联合推出的Mamba架构可能...
CMU普林斯顿合力推出Mamba新架构,颠覆Transformer霸权,推理速度暴增5倍,解决致命bug

全面开源的千亿模型:源2.0全家桶突破算力限制,代码数学强悍

AIGC动态欢迎阅读 昨天,浪潮信息发布了源2.0基础大模型,并且一口气开源了1026亿、518亿、21亿三个大模型!在编程、推理、逻辑等难题上,源2.0展现了非凡性能。这是国内第一个全面开源的千亿模型!浪潮信息正式发布了源2.0,无论是2B、51B,还是102B,全部都已开源。这次,源2.0不仅在...
全面开源的千亿模型:源2.0全家桶突破算力限制,代码数学强悍

BERT和GPT:不使用Attention和MLPs的最佳替代方案

本文介绍了一种名为Monarch Mixer (M2) 的新架构,该架构在序列长度和模型维度上具有高效的硬件效率。文章从BERT、GPT到SAM和Stable Diffusion等模型展开探讨,指出Transformer虽然当前风头正劲,但并非唯一选择。建议阅读原文以获取更多信息。如果需要联系作者,...
BERT和GPT:不使用Attention和MLPs的最佳替代方案

LeCun力赞DeepMindTransformer:卷积网络仍然强大无比

文章标题为"DeepMind Transformer最强传说,LeCun夸赞",主要掐点在于研究人员发现在相同的计算量下,卷积神经网络模型和视觉Transformers模型的性能能够相媲美。这一发现引起了广泛关注,涉及关键字为模型、研究人员、卷积、预算和性能。文章来源于新智元,全...
LeCun力赞DeepMindTransformer:卷积网络仍然强大无比

LeCun与xAI联合创始人争论:GPT-4存在严重推理缺陷?网友质疑:人类也有“随机鹦鹉”行为

AIGC动态欢迎阅读原标题:LeCun和xAI联创对GPT-4提出质疑,指出其推理能力缺陷难以解决?网友表示人类也存在“随机鹦鹉”现象。关键词:能力、人类、专家、鹦鹉、卷积文章来源:新智元内容字数:6867字内容摘要:新智元报道编辑:润【新智元导读】LeCun和其他学者再次批评LLM的推理能力,引发...
LeCun与xAI联合创始人争论:GPT-4存在严重推理缺陷?网友质疑:人类也有“随机鹦鹉”行为

将旧模型重编程到新任务:轻量级持续学习中的0.6%额外参数

这篇文章介绍了机器之心编辑部持续学习的主题,重点在于模仿人类在连续任务中持续积累知识的能力。其中提到,持续学习的主要挑战在于如何确保在学习新任务后仍保持对以前所学任务的表现,避免灾难性遗忘。相比之下,持续学习和多任务学习在方法上有所不同,多任务学习可以同时学习不同任务,而持续学习则是逐个学习任务。原...
将旧模型重编程到新任务:轻量级持续学习中的0.6%额外参数