视频

共 287 篇文章

迎接未来:首个多视图预测与规划的自动驾驶世界模型

本文介绍了最新的自动驾驶技术——多视图预测和规划自动驾驶世界模型。该模型通过多视图世界模型,可以预测不同规划路线的未来情景,并根据视觉预测获取奖惩反馈,从而提高自动驾驶系统的安全性。研究团队提出的 Drive-WM 模型旨在增强端到端自动驾驶规划的安全性。近期在 CVPR2023 自动驾驶研讨会上,...
迎接未来:首个多视图预测与规划的自动驾驶世界模型

GPT-4V和人类合作培训机器人:实现眼睛和手的同步学习

本文摘要来自机器之心,介绍了微软提出的使用GPT-4V和人类演示来训练机器人的新方法。通过GPT-4V解析视频动作,生成行为表述作为任务列表,从而实现训练机器人的目的。这种方法绕过了传统收集数据和训练模型的过程,展示了灵活性和适应性,特别是在结合通用视觉大模型(如GPT-4V)的情况下。这种方法为开...
GPT-4V和人类合作培训机器人:实现眼睛和手的同步学习

梅西、钢铁侠、二次元姐纷纷挑战「科目三」,引发全网模仿狂潮

在最近的一篇机器之心文章中,报道了来自阿里的研究团队提出的一项名为“Animate Anyone”的方法。这种方法只需要一张人物照片,再配合骨骼动画引导,就可以生成动画视频。最近,某舞蹈动作“科目三”在网络上掀起了一阵热潮,许多人模仿其摇花手、半崴不崴的脚步,并配以明快的音乐节奏。如果让人工智能生成...
梅西、钢铁侠、二次元姐纷纷挑战「科目三」,引发全网模仿狂潮

斯坦福华人女博士退学创业,6个月打造爆火文生视频”Pika”,4人团队估值超过2亿美元

这篇文章讨论了一位斯坦福华人女博士退学创业的故事,她与团队6个月内打造了备受关注的视频产品Pika,估值超过2亿美元。该产品具有生成和编辑多种风格视频的能力,发布后备受瞩目。文章中提到创始人均为斯坦福AI Lab博士生,分别是CEO郭文景(Demi Guo)和CTO Chenlin Meng。他们的...
斯坦福华人女博士退学创业,6个月打造爆火文生视频”Pika”,4人团队估值超过2亿美元

北大新发布的多模态大模型:可在混合数据集上直接应用于图像和视频任务训练

欢迎阅读AIGC动态近期,北大发布了最新的多模态大模型开源消息,该模型可在混合数据集上进行训练,无需修改即可用于图像和视频任务。关键词:视觉、视频、模型、图片、方法文章来源:量子位字数:5682字文章摘要:北京大学和中山大学联合团队最近提出一种构建统一的图片和视频表征框架的方法。他们通过这一框架,大...
北大新发布的多模态大模型:可在混合数据集上直接应用于图像和视频任务训练

斯坦福华人女博士退学创业,六个月内打造爆款生活视频APP Pika 1.0,四人团队估值超过20亿美元

欢迎阅读AIGC动态原标题:斯坦福华人女博士辍学创业,仅用6个月打造爆火文生成视频产品Pika 1.0,其4人团队估值超过20亿美元关键词:知乎、斯坦福大学、视频、福布斯、创始人文章来源:夕小瑶科技说内容字数:5039字内容摘要:夕小瑶科技说原创作者 | 王二狗大家好,我是二狗。今天,AI视频生成产...
斯坦福华人女博士退学创业,六个月内打造爆款生活视频APP Pika 1.0,四人团队估值超过20亿美元

北大仅用3天训练130亿参数的Chat-UniVi统一图片和视频理解大模型

最新动向的介绍原文题目:北大提出Chat-UniVi:在3天内训练130亿大模型实现图片和视频统一理解关键词:视觉,模型,视频,图片,表征文章来源:机器之心原文字数:5352字内容摘要:在最新的机器之心专栏中,北京大学及中山大学的研究团队提出了一种名为Chat-UniVi的统一视觉语言大模型。该模型...
北大仅用3天训练130亿参数的Chat-UniVi统一图片和视频理解大模型

4人团队发布Pika 1.0视频,OpenAI联合创始人参与投资,估值达2亿

最新消息显示,斯坦福华人博士文生视频Pika 1.0受到了极大关注。这家仅有四人的初创公司不仅获得了5500万美元的融资,估值达到了2亿美元,而且在短短半年内用户数量就超过了50万。今日,Pika 1.0正式发布,其电影级特效让整个网络为之震撼。Pika在AI生视频领域已经取得了令人瞩目的成就,即将...
4人团队发布Pika 1.0视频,OpenAI联合创始人参与投资,估值达2亿

DeepMind发布高效的小规模多模态解决方案Mirasol 3B

《AIGC动态欢迎阅读》 原标题:规模小、效率高:DeepMind推出多模态解决方案Mirasol 3B 关键字:视频,模型,音频,组件,表征 文章来源:机器之心 内容字数:3607字 摘要:机器之心报道了机器之心编辑部进行的性能优于规模更大的模型的研究。多模态学习面临的主要挑战之一是需要融合文本、...
DeepMind发布高效的小规模多模态解决方案Mirasol 3B

咪蒙短剧火遍全球,土味霸总成爆款引热议。

《AIGC动态欢迎阅读》 近期,一部名为《GOODBYE MY CEO》的微短剧在海外掀起轩然大波,成功吸引了欧美观众的目光。这部热门微短剧源自知名短视频应用ReelShort,该应用在不到一年的时间里击败了TikTok,登上多国App Store榜首。成功之谜在于它将中国的爽剧完美“本土化”,呈现...
咪蒙短剧火遍全球,土味霸总成爆款引热议。

GPT-4与物理引擎结合的扩散模型,打造逼真流畅且合乎逻辑的视频

AIGC动态欢迎阅读 文章标题:GPT-4+物理引擎加持扩散模型,实现视频逼真、连贯、合理 关键词:物理、视频、模型、用户、物体 文章来源:机器之心 文章字数:6142字 内容摘要:最近,随着扩散模型技术的应用,文本生成视频技术得到了进一步发展。然而,这类方法的计算成本通常较高,而且往往难以实现连贯...
GPT-4与物理引擎结合的扩散模型,打造逼真流畅且合乎逻辑的视频

原来还有这样的“表情包续集”!Stable Video创意玩法引爆网络

在《AIGC动态》欢迎您的阅读。今天我们要分享的是来自量子位的文章,原题为:“经典表情包原来还有这“续集”!Stable Video创意玩法火了”。通过使用AI技术将经典表情包升级为视频,这种创意玩法最近备受瞩目。比如,最经典的“男人扭头看红裙女子”表情包如今有了新的变化。除此之外,还有许多其他经典...
原来还有这样的“表情包续集”!Stable Video创意玩法引爆网络

PixelDance:视频制作新境界,展现复杂动作与炫酷特效

在视频生成领域,最新的技术进展备受关注。最近,许多公司相继推出了新模型,为视频生成带来了重大突破。例如,Runway升级了Gen-2模型,提供了电影级别的高清晰度,使视频生成技术大幅进步。然而,虽然Gen-2在一致性方面取得了显著改进,但在捕捉动态性方面还存在挑战。另一方面,Meta推出了Emu V...
PixelDance:视频制作新境界,展现复杂动作与炫酷特效

北大发布全新Video-LLaVA视觉语言大模型,视频问答技术达到新高度

本文报道的是来自北京大学等机构研究者提出的一种新型全新视觉语言大模型——Video-LLaVA。该模型使得LLM能够同时接收图片和视频作为输入,并在下游任务中表现出色,在图片和视频13个基准上达到先进性能。这一研究结果表明,统一LLM的输入可以提升其视觉理解能力。与传统的视觉语言大模型不同,Vide...
北大发布全新Video-LLaVA视觉语言大模型,视频问答技术达到新高度

稳定视频传播技术问世!3D合成功能获关注,网友称进步迅速

欢迎阅读AIGC动态 原文标题:稳定视频扩散问世!引起3D合成功能的关注,网友:进步太快 关键词:小米、视频、模型、官方、视角 文章来源:量子位 文章字数:3425字 文章摘要:来自凹非寺量子位的西风报道| 公众号 QbitAI。Stability AI 官方终于开始涉足视频领域——推出生成式视频模...
稳定视频传播技术问世!3D合成功能获关注,网友称进步迅速

英伟达打造符合中国要求的芯片;特斯拉AI模型Grok下周定向开放;拼多多组建大规模模型团队丨AIGC大事日报

AIGC动态欢迎阅读 近期的重要动态包括:英伟达宣布将为中国开发定制合规芯片;马斯克的AI模型Grok将于下周对特定用户开放;拼多多成立了大模型团队。这些内容均可在AIGC大事日报中了解到。 关键字:董事会、模型、微软、视频、公司 文章来源:AI导航 内容字数:5054字 内容摘要:11月22日全球...
英伟达打造符合中国要求的芯片;特斯拉AI模型Grok下周定向开放;拼多多组建大规模模型团队丨AIGC大事日报

视频稳定传输上线啦,现已添加代码权重

最近,AI 领域迎来了一项重要的更新:Stable Video Diffusion模型的问世。Stability AI 公司推出了这一视频生成模型,给人们留下了深刻印象。该模型继承了公司原有的 Stable Diffusion 文生成图模型,现在用户们有机会基于静止图像生成短视频。Stable Vi...
视频稳定传输上线啦,现已添加代码权重

清华AI叉院神器:BLACKPINK首度亮相二次元领域

AIGC动态欢迎您的阅读本文原题为:当韩国女团BLACKPINK进军二次元,看清华叉院AI神器的新玩法关键词:效果、视频、模型、工作流、风格文章来源:机器之心全文字数:3603字简要内容:编辑张倩为您介绍 AI 制作的女团MV效果。若您使用过某些修图软件,可能熟悉“AI绘画”功能,通常能将照片转换为...
清华AI叉院神器:BLACKPINK首度亮相二次元领域

浙大团队斩获唯一最佳论文奖,三项大奖落入中国团队之手!ACM MultiMedia 2023揭晓盛况

本文报道了2023 ACM MultiMedia会议上中国团队取得的三项大奖,展示了中国在多媒体领域的新突破。其中,浙江大学团队、南京航空航天大学团队和清华大学团队的成果在3072篇投稿中脱颖而出,分别荣获最佳论文奖(Best Paper Award)和荣誉提名奖。此次会议录用了902篇论文,录用率...
浙大团队斩获唯一最佳论文奖,三项大奖落入中国团队之手!ACM MultiMedia 2023揭晓盛况

Runway 强势竞品 Pika 1.0 即将发布!视频效果媲美迪士尼动画,引领动画生成新潮流!

AIGC动态欢迎阅读 近日,夕小瑶科技说发布了关于Runway竞争新品Pika 1.0的预告,声称其视频效果可媲美迪士尼动画,重新定义了动画生成的新标准。 这一消息迅速引起了关注,网友们纷纷为其效果和画质惊叹不已,赞叹其Amazing和Unexpected,有人甚至表示未来已经来临。据称,pika1...
Runway 强势竞品 Pika 1.0 即将发布!视频效果媲美迪士尼动画,引领动画生成新潮流!

如何选择适合的AI写论文软件

如今,人工智能(AI)技术的迅速发展推动了越来越多人使用AI写作软件来辅助完成学术论文。市场上涌现了众多AI写作软件,使选择最佳软件成为一项挑战。本文将为您提供选购指南,帮助您找到最适合自己的AI写作软件。 在选择AI写作软件时,首要考虑软件的功能和效果。在明确个人需求之前,需了解不同软件的特点。有...
AGI3年前
如何选择适合的AI写论文软件

深度强化学习完全指南:从基础概念到专业水平

深度强化学习是人工智能领域备受关注的技术之一,将深度学习与强化学习理论相融合,拥有广泛的应用前景。对于初学者而言,如何开始学习深度强化学习是一个至关重要的问题。接下来,我们将从基础概念入手,为您提供一份深度强化学习的入门指南。 深度强化学习是一种机器学习方法,通过智能体与环境的交互学习,旨在在特定环...
AGI3年前
深度强化学习完全指南:从基础概念到专业水平

深度学习新手必读:快速入门指南

深度学习在人工智能领域占据重要地位,掌握其基础知识和技能对于相关工作和研究至关重要。以下将介绍一些快速入门深度学习的方法和步骤。 首先,理解深度学习的基本概念至关重要。深度学习模仿人脑神经网络的工作原理,通过多层次的神经网络进行数据特征的学习和提取。掌握神经网络结构、激活函数和损失函数等基本概念是入...
AGI3年前
深度学习新手必读:快速入门指南

深度学习初学者推荐文献及阅读方法

深度学习作为人工智能领域中备受关注的重要分支,对于希望入门深度学习的初学者来说,选择适合的入门文献至关重要。以下将介绍一些推荐的深度学习入门文献以及有效的阅读方法,以帮助初学者顺利掌握深度学习。 推荐的经典深度学习入门文献包括《Deep Learning》一书,由Ian Goodfellow、Yos...
AGI3年前
深度学习初学者推荐文献及阅读方法

OpenAI新品「陈天奇GPT」实测:10分钟快速定制体验!Sam Altman发声,千家AI初创公司打响战鼓

AIGC动态欢迎阅读原文标题:10分钟内打造“陈天奇GPT”,体验OpenAI最新产品!Sam Altman发表看法,众多AI初创公司备受冲击关键词:图像,网友,视频,开发者,应用程序文章来源:新智元字数统计:7601字内容简介:新智元编辑报道:编辑部【新智元导读】OpenAI掀起了一场革命,让用户...
OpenAI新品「陈天奇GPT」实测:10分钟快速定制体验!Sam Altman发声,千家AI初创公司打响战鼓

开发者利用OpenAI GPT-4视觉API,创新解说梅西足球比赛和英雄联盟游戏【修改后的标题】

AIGC动态欢迎阅读原标题:OpenAI GPT-4视觉API被开发者玩出新花样,解析梅西球赛和英雄联盟关键词:解读,字节跳动,开发者,视频,实时本文摘自:机器之心字数统计:4008字本文摘要:机器之心的编辑张倩报道,使用了OpenAI视觉API的开发者们深感惊叹。文章开头描述了一段体育比赛解说视频...
开发者利用OpenAI GPT-4视觉API,创新解说梅西足球比赛和英雄联盟游戏【修改后的标题】

深度学习算法中的革命——CNN卷积神经网络在计算机视觉领域的巨大影响力

卷积神经网络(CNN)是一种基于人工神经网络的深度学习算法,已经在计算机视觉领域带来了革命性的影响。它通过模仿生物视觉系统的工作原理,利用多个卷积层和池化层进行特征提取和空间下采样,以实现对图像和视频数据的高效处理和分析。CNN的原理基于对图像数据的局部连接和共享权重,与传统的全连接神经网络相比,C...
AGI3年前
深度学习算法中的革命——CNN卷积神经网络在计算机视觉领域的巨大影响力

深度学习中不可或缺的卷积神经网络:应用与原理解析

卷积神经网络(CNN)是专门处理二维数据如图像和视频的深度学习模型,在计算机视觉领域扮演至关重要的角色。卷积神经网络通过多次卷积和全连接层的结合,实现对图像特征的提取和分类,取得了在图像识别、目标检测、人脸识别等领域的巨大成功。 卷积神经网络的“卷积”指的是一种数学运算,有助于提取图像的特征;而“神...
AGI3年前
深度学习中不可或缺的卷积神经网络:应用与原理解析

揭秘深度学习:引领智能革命的前沿技术

深度学习是一种利用人工神经网络的机器学习技术,在自然语言处理、计算机视觉、语音识别等领域被广泛应用。该技术核心理论模拟人脑神经元之间的连接和信息传递方式,通过训练神经网络模型来模拟学习和解决问题。 神经网络是深度学习的关键组成部分,由大量人工神经元构成数学模型,类似生物神经元,通过模拟人类大脑工作方...
AGI3年前
揭秘深度学习:引领智能革命的前沿技术

探索虚拟世界的艺术与科学:GAN生成对抗网络

生成对抗网络(GAN)是一种深度学习模型,在计算机图形学、计算机视觉和人工智能等领域得到广泛应用。其灵感源于对自然界创作和创造过程的理解,由生成网络(Generator)和判别网络(Discriminator)两部分组成,相互对抗。 在GAN中,生成网络学习输入数据的概率分布,生成看似真实但实际上是...
AGI3年前
探索虚拟世界的艺术与科学:GAN生成对抗网络

抗议活动肆虐美国多地,CNN记者遭到警察粗暴对待

CNN(卷积神经网络)是一种受到生物神经系统启发的人工神经网络模型,模仿人类视觉系统的工作原理,通过多层神经网络进行图像处理和分析。其核心思想是利用卷积操作和池化操作对图像进行特征提取,实现图像的自动识别和分类。相较于传统的图像处理方法,CNN具有更强的表达能力和更高的准确性。 在计算机视觉领域,C...
AGI3年前
抗议活动肆虐美国多地,CNN记者遭到警察粗暴对待

探寻生成对抗网络在深度学习领域的最新进展和改进

生成对抗网络(Generative Adversarial Networks, GANs)是深度学习领域的一项重大突破。其由生成网络和判别网络组成,通过对抗学习不断优化模型,使得生成网络能够生成逼真的图片、音频和视频。尽管GANs取得显著成果,仍面临一些挑战。 在训练过程中,GANs常难以收敛,容易...
AGI3年前
探寻生成对抗网络在深度学习领域的最新进展和改进

工信部发布《促进新一代人工智能产业发展三年行动计划》

为进一步贯彻党的十九大精神,加速发展先进制造业,推动人工智能与实体经济深度融合,贯彻“中国制造2025”和《新一代人工智能发展规划》,工业和信息化部最近发布了《促进新一代人工智能产业发展三年行动计划(2018-2020年)》。该行动计划以信息技术和制造技术深度融合为主线,聚焦于新一代人工智能技术的产...
AGI3年前
工信部发布《促进新一代人工智能产业发展三年行动计划》
1 2 3 4 8