视觉

共 74 篇文章

MiniGPT-4升级版本MiniGPT-v2:多模态任务更高效

《AIGC动态》欢迎阅读 原标题:MiniGPT-4升级为MiniGPT-v2,无需使用GPT-4也能完成多模态任务 关键词:模型、任务、语言、视觉、本文 文章来源:机器之心 内容字数:4030字 内容摘要:机器之心编辑部介绍,MiniGPT-v2将大语言模型作为视觉语言多任务学习的统一接口。几个月...
MiniGPT-4升级版本MiniGPT-v2:多模态任务更高效

十年变革:深度学习与经典元素共挑重任

近年来,计算机视觉(CV)领域蓬勃发展,渗透到各个领域。尽管对大众而言,这可能是一项新奇且令人振奋的科技创新,但实际上,计算机视觉已有几十年的发展历史。早在20世纪70年代,为当前许多算法奠定了坚实基础。约十年前,一项当时处于理论阶段的新技术崭露头角:深度学习,这种利用神经网络解决复杂问题的人工智能...
十年变革:深度学习与经典元素共挑重任

谷歌与CMU合作研究:大语言模型击败扩散模型,视频图像生成双SOTA,北大校友担任一作

欢迎阅读AIGC动态 原标题:大型语言模型击败传统扩散模型!视频和图像生成双SOTA,最新研究由谷歌CMU团队完成,主要作者是北大校友。 关键词:模型、视觉、语言、分词、人工智能 文章来源:量子位 内容字数:2561字 内容摘要:最新来自凹非寺量子位发布的消息称,语言模型在视频和图像生成领域取得双重...
谷歌与CMU合作研究:大语言模型击败扩散模型,视频图像生成双SOTA,北大校友担任一作

升级版美图视觉大师 3.0:设计师的甲方之选

AIGC动态欢迎阅读 原文标题:美图视觉大模型 3.0:让设计师做甲方 关键词:模型、视觉、设计师、效果、创意 文章来源:AI科技评论 内容字数:8467字 内容摘要:AI工作流提效之战正式开启。本文撰写:郭思编辑:陈彩娴。ChatGPT之前,国内最近一次的AI热潮是以“AI四小龙”的发展为代表,但...
升级版美图视觉大师 3.0:设计师的甲方之选

语言模型首次战胜扩散模型在图像和视频生成中,tokenizer关键性作用凸显

AIGC动态欢迎阅读 原标题:在图像、视频生成上,语言模型首次击败扩散模型,tokenizer是关键 关键词:模型, 视觉, 语言, 视频, 本文 文章来源:机器之心 内容字数:6122字 内容摘要:机器之心报道编辑:张倩、陈萍。为何语言模型在视觉生成方面落后于扩散模型?来自谷歌、CMU的研究表明,...
语言模型首次战胜扩散模型在图像和视频生成中,tokenizer关键性作用凸显

美图秀秀推出全新自研大模型,多种AIGC玩法让你畅快体验

AIGC动态欢迎阅读 原标题:美图秀秀推出最新自主研发大型模型,各类AIGC玩法可直接体验 关键词:模型,创作者,美学,视觉,工作流 文章来源:量子位 内容字数:5639字 近日,厦门量子位的明敏发布了最新文章,介绍了美图公司推出的自研大型模型3.0版本。这一新版本已全面应用于美图旗下的影像与设计产...
美图秀秀推出全新自研大模型,多种AIGC玩法让你畅快体验

清华大学唐杰团队与智谱合作,发布多模态14边形战士,挑战GPT-4V,在线可玩

AIGC动态欢迎阅读 原文标题:挑战GPT-4V!清华唐杰&智谱开源多模态14边形战士,在线可玩 关键词:模型、量子、深度、视觉、语言 文章来源:量子位 内容字数:2140字 内容摘要:本文由梦晨撰写,发表于凹非寺量子位公众号QbitAI。你能看出这张图中有几个房子吗?如果你的答案是3个,那...
清华大学唐杰团队与智谱合作,发布多模态14边形战士,挑战GPT-4V,在线可玩

MiniGPT-5新特性发布:Token转化为Voken,新增图文交叉生成功能

AIGC动态欢迎阅读 原标题:野心勃勃的MiniGPT-5出现了!Token变Voken,支持图文交叉生成 关键词:模型、图像、文本、阶段、视觉 文章来源:夕小瑶科技说 内容字数:6092字 内容摘要:夕小瑶科技说 分享来源 | 机器之心大模型正在实现语言和视觉的跨越,有望无缝地理解和生成文本和图像...
MiniGPT-5新特性发布:Token转化为Voken,新增图文交叉生成功能

MiniGPT-5发布:Token变Voken,文图生成新功能助力创作

AIGC动态欢迎阅读 原标题:统一图像和文字生成的MiniGPT-5来了:Token变Voken,模型不仅能续写,还会自动配图了 关键词:模型、图像、文本、阶段、视觉 文章来源:机器之心 内容字数:6726字 内容摘要:机器之心报道机器之心编辑部OpenAI的GPT-5大型模型似乎还遥遥无期,但已经...
MiniGPT-5发布:Token变Voken,文图生成新功能助力创作

微软发布《GPT-4V多模态大模型》166页使用指南,速览简报

AIGC动态欢迎阅读 微软发布了长达166页的多模态大模型GPT-4V使用指南,本文对其进行了速览。 关键词:报告、视觉、能力、图像、解读 文章来源:夕小瑶科技说 本文内容共7737字。 夕小瑶科技说在一周前分享了本文,内容为机器之心的作者陈萍和张倩。ChatGPT最近迎来了重大更新,包括GPT-4...
微软发布《GPT-4V多模态大模型》166页使用指南,速览简报

康奈尔大学研究:小鼠也有VR头显了,开颅探究大脑和行为

这篇文章是关于康奈尔大学的研究者们给小鼠戴上虚拟现实(VR)头显的报道。通过这项沉浸式研究,他们希望了解大脑和行为之间的关系。这篇文章来源于新智元,全文5348字。文章介绍了研究者们为小鼠制造的MouseGoggles虚拟现实头显,并提到了小鼠在接受这种体验前需要进行开颅手术。这表明小鼠也已经进入了...
康奈尔大学研究:小鼠也有VR头显了,开颅探究大脑和行为

微软最新发布的166页测评报告:揭秘视觉模态GPT-4V的强大之处

AIGC动态欢迎您的阅读原文标题:微软最新166页测评报告:视觉模态GPT-4V的强大之处如何?关键词:报告、视觉、能力、图像、解读文章来源:创始人公园内容字数:8779字内容摘要:本文来源于机器之心。一周前,ChatGPT迎来了重大更新,无论是GPT-4还是GPT-3.5模型,都能够基于图像进行分...
微软最新发布的166页测评报告:揭秘视觉模态GPT-4V的强大之处

微软发布166页GPT-4V测评报告,业内人士强烈推荐高级用户阅读

最新动态:AIGC专题 原题:微软发布了长达166页的关于GPT-4V的测评报告。业内人士称之为高级用户必读 关键词:报告、视觉能力、图像解读 稿件来源:机器之心 文章字数:8579字 内容摘要:微软发布了一份针对GPT-4V功能的深度研究报告,适合任何有兴趣挖掘GPT-4V潜力的人阅读。ChatG...
微软发布166页GPT-4V测评报告,业内人士强烈推荐高级用户阅读

多模态大模型的综合审查:从专家级到通用助手

欢迎阅读AIGC动态 这篇文章原题为:《多模态大模型综述:从专家到通用助手》。关键词包括:报告、模型、视觉、作者、微软。文章转载自量子位,Founder Park经过调整。文章全文共5516字,其中详细总结了当前已完善及前沿研究领域中两类多模态大模型的发展方向,并围绕五个具体研究主题展开讨论:视觉理...
多模态大模型的综合审查:从专家级到通用助手

探秘微软最新发布的多模态基础模型及其AI代理应用

AIGC动态欢迎阅读 原标题:微软最新发布:从专家到通用AI代理,一文读懂「多模态基础模型」 关键词:模型、视觉、报告、图像、基础 文章来源:人工智能学家 内容字数:7702字 内容摘要:视觉作为人类和其他生物感知世界的主要途径之一。人工智能(AI)的核心愿景之一是开发AI代理,模拟感知并生成视觉信...
探秘微软最新发布的多模态基础模型及其AI代理应用

KOSMOS-2.5:探索「文本密集图像」的多模态大语言模型

AIGC动态欢迎您的阅读 原标题:文档字数越多,模型越兴奋!KOSMOS-2.5:探索「文本密集图像」的多模态大语言模型 关键词:文本、模型、图像、任务、视觉 文章来源:新智元 文本长度:6086字 内容摘要:新智元报道编辑:LRS 好困【新智元导读】语言本身也是一种视觉信息,多模态大语言模型KOS...
KOSMOS-2.5:探索「文本密集图像」的多模态大语言模型

马毅团队新研究:微调多模态大模型导致”灾难性遗忘”,性能显著下降

本文是关于马毅团队最新研究的动态报道。研究指出,微调多模态大语言模型(MLLM)可能导致灾难性遗忘问题,这已成为当前热门话题之一,即使像GPT-4这样的模型也难以避免。最近,来自UC伯克利、NYU等机构的研究人员发现,微调后的多模态大模型可能会遭受灾难性遗忘。他们在论文中探讨了这一问题,并表示这是关...
马毅团队新研究:微调多模态大模型导致”灾难性遗忘”,性能显著下降

多模态大模型: 未来人机交互的发展方向?

AIGC动态欢迎阅读原标题:多模态大模型会是未来人机交互的方向吗?关键字:模型,语音,信息,用户,视觉文章来源:人工智能学家内容字数:21282字内容摘要:目前市面上的交互产品主要以单模式交互为主,尤其是语音交互。语音产品通常是以语音助手的形态呈现。语音交互相较于按键操作,能够提供更为便捷的体验,尤...
多模态大模型: 未来人机交互的发展方向?

IEEE杰出会员张磊:在手机端实现大模型的普及刻不容缓

AIGC动态欢迎阅读近期IEEE Fellow张磊发表观点称,普及大型模型并在手机端实现创新至关重要。关键词涉及模型、视觉、工业界、科技以及底层。这一信息来自AI科技评论,总字数为13150字。文章内容主要探讨了大型模型规模化部署的挑战和重要性,特别是在手机端创新的影响。2022年底以来,大型模型如...
IEEE杰出会员张磊:在手机端实现大模型的普及刻不容缓

微软7位研究员合作撰写的多模态大模型全面综述:涵盖5大主题,共计119页

欢迎阅读AIGC动态 原标题:微软7位研究员合作撰写多模态大模型最全综述,涵盖5大主题,共119页内容 关键词:报告、模型、视觉、作者、微软 文章来源:量子位 字数:5098字 内容摘要:此为量子位公众号文章,介绍了由微软7位华人研究员撰写的多模态大模型综述,共计119页。该综述从当前已完善和最前沿...
微软7位研究员合作撰写的多模态大模型全面综述:涵盖5大主题,共计119页

OpenAI准备对抗谷歌Gemini:推出多模态大模型和新指令语言模型

欢迎阅读AIGC动态 原标题:OpenAI与谷歌Gemini展开激烈竞争:全力推进多模态大模型,并发布新指令语言模型 关键词:报告, 模型, 视觉, 语言, 指令 文章来源:AI前线 文章字数:5863字 文章摘要:经过OpenAI去年底推出ChatGPT引起全球轰动后,该公司一直以惊人的速度发布新...
OpenAI准备对抗谷歌Gemini:推出多模态大模型和新指令语言模型

颜水成与他的学生们:揭秘七次 CV 夺冠背后

AIGC动态欢迎阅读原题目:揭秘七次获得CV冠军的背后:颜水成及其学生们关键词:视觉、团队、卷积、深度、技术文章来源:AI科技评论内容字数:19689字内容摘要:这是一场深度学习浪潮,七次世界冠军,两次跟随者…… 作者:李梅、郭思 编辑:岑峰 他们不仅搭上了人工智能的热潮,更是创造了这场热潮本身。2...
颜水成与他的学生们:揭秘七次 CV 夺冠背后

水下探测技术:关键技术与智能装备

<img src=""> 欢迎阅读AIGC动态 原文标题:涉水视觉:从关键技术到智能装备 关键词:视觉、技术、环境、光学、图像 文章来源:机器之心 字数:9731字 摘要:《涉水视觉》一文探讨了光与水的相互作用和跨介质传播机制,介绍了涉水成像和图像解析领域的最新研究进...
水下探测技术:关键技术与智能装备

RACV2023:大规模模型和ChatGPT对计算机视觉的影响总结

AIGC动态欢迎阅读 原标题:RACV2023观点集锦 | 大模型&ChatGPT对计算机视觉的影响 关键词:模型,视觉,任务,报告,领域 文章来源:夕小瑶科技说 内容字数:53325字 内容摘要:在ChatGPT的大热背景下,大型模型在计算机视觉中的作用,以及如何应用这些大型模型来处理各种...
RACV2023:大规模模型和ChatGPT对计算机视觉的影响总结

阿里云AI大模型通用问答千问完成备案,全面开放!

在最新的消息中,阿里云宣布了通义千问大模型已经通过备案,并且正式向公众开放。这一消息意味着该模型将为用户带来更丰富的AI应用体验。此前,百度的“文心一言”、阿里巴巴的“通义千问”以及360的“360智脑”等多款产品已经面世,其中百度的产品已经开始在一些场景得到实际应用。随着ChatGPT在全球范围内...
阿里云AI大模型通用问答千问完成备案,全面开放!

Meta发布FACET:大规模视觉模型评估基准,DINOv2视觉模型开源商用

AIGC动态欢迎阅读近期,Meta发布了一项重要消息:他们开源了计算机视觉模型DINOv2,并且可以商业化应用了。同时发布了全新的视觉模型评估基准FACET。DINOv2是Meta AI继「分割一切」SAM模型之后发布的另一个重要视觉基础模型。在今年4月份宣布开源时,仅能用于技术研究,而现在在Apa...
Meta发布FACET:大规模视觉模型评估基准,DINOv2视觉模型开源商用

字节发布 Vi-PRoM 视觉预训练方案,提高机器人操作成功率和效果

欢迎阅读AIGC动态本文所报道的动态标题为:“字节提出 Vi-PRoM 视觉预训练方案,提高机器人操作成功率和操作效果”。与机器人、视觉、操作、语义和数据相关的关键词被提及。文章来源于机器之心,内容字数为4831字。文章摘要显示,ByteDance Research 团队的研究者在机器人操作能力方面...
字节发布 Vi-PRoM 视觉预训练方案,提高机器人操作成功率和效果
1 2