华人团队打造的超热门Mini GPT-4在视觉能力上大幅提升,GitHub星数达两万 <img src=""> AIGC动态欢迎阅读 原标题:超火迷你GPT-4视觉能力暴涨,GitHub两万星,华人团队出品 关键字:视觉,模型,任务,指令,量子 文章来源:量子位 内容字数:2492字 内容摘要:最新报道指出,GPT-4V虽然在目标检测上表现出色,但仍有... AI工具箱3年前
MQ-Det登上NeurIPS 2023,多模态开放世界检测大模型,精确率提升7.8% AIGC动态欢迎阅读 原文题目:精确率提升7.8%!首个多模态开放世界检测大模型MQ-Det登NeurIPS 2023 关键词:文本、模型、目标、视觉、示例 文章来源:新智元 内容字数:10172字 内容摘要:新智元报道编辑:LRS【新智元导读】MQ-Det是在已有基于文本查询的检测大模型基础上加入... AI工具箱3年前
MiniGPT-4升级版本MiniGPT-v2:多模态任务更高效 《AIGC动态》欢迎阅读 原标题:MiniGPT-4升级为MiniGPT-v2,无需使用GPT-4也能完成多模态任务 关键词:模型、任务、语言、视觉、本文 文章来源:机器之心 内容字数:4030字 内容摘要:机器之心编辑部介绍,MiniGPT-v2将大语言模型作为视觉语言多任务学习的统一接口。几个月... AI工具箱3年前
十年变革:深度学习与经典元素共挑重任 近年来,计算机视觉(CV)领域蓬勃发展,渗透到各个领域。尽管对大众而言,这可能是一项新奇且令人振奋的科技创新,但实际上,计算机视觉已有几十年的发展历史。早在20世纪70年代,为当前许多算法奠定了坚实基础。约十年前,一项当时处于理论阶段的新技术崭露头角:深度学习,这种利用神经网络解决复杂问题的人工智能... AI工具箱3年前
谷歌与CMU合作研究:大语言模型击败扩散模型,视频图像生成双SOTA,北大校友担任一作 欢迎阅读AIGC动态 原标题:大型语言模型击败传统扩散模型!视频和图像生成双SOTA,最新研究由谷歌CMU团队完成,主要作者是北大校友。 关键词:模型、视觉、语言、分词、人工智能 文章来源:量子位 内容字数:2561字 内容摘要:最新来自凹非寺量子位发布的消息称,语言模型在视频和图像生成领域取得双重... AI工具箱3年前
升级版美图视觉大师 3.0:设计师的甲方之选 AIGC动态欢迎阅读 原文标题:美图视觉大模型 3.0:让设计师做甲方 关键词:模型、视觉、设计师、效果、创意 文章来源:AI科技评论 内容字数:8467字 内容摘要:AI工作流提效之战正式开启。本文撰写:郭思编辑:陈彩娴。ChatGPT之前,国内最近一次的AI热潮是以“AI四小龙”的发展为代表,但... AI工具箱3年前
语言模型首次战胜扩散模型在图像和视频生成中,tokenizer关键性作用凸显 AIGC动态欢迎阅读 原标题:在图像、视频生成上,语言模型首次击败扩散模型,tokenizer是关键 关键词:模型, 视觉, 语言, 视频, 本文 文章来源:机器之心 内容字数:6122字 内容摘要:机器之心报道编辑:张倩、陈萍。为何语言模型在视觉生成方面落后于扩散模型?来自谷歌、CMU的研究表明,... AI工具箱3年前
美图秀秀推出全新自研大模型,多种AIGC玩法让你畅快体验 AIGC动态欢迎阅读 原标题:美图秀秀推出最新自主研发大型模型,各类AIGC玩法可直接体验 关键词:模型,创作者,美学,视觉,工作流 文章来源:量子位 内容字数:5639字 近日,厦门量子位的明敏发布了最新文章,介绍了美图公司推出的自研大型模型3.0版本。这一新版本已全面应用于美图旗下的影像与设计产... AI工具箱3年前
清华大学唐杰团队与智谱合作,发布多模态14边形战士,挑战GPT-4V,在线可玩 AIGC动态欢迎阅读 原文标题:挑战GPT-4V!清华唐杰&智谱开源多模态14边形战士,在线可玩 关键词:模型、量子、深度、视觉、语言 文章来源:量子位 内容字数:2140字 内容摘要:本文由梦晨撰写,发表于凹非寺量子位公众号QbitAI。你能看出这张图中有几个房子吗?如果你的答案是3个,那... AI工具箱3年前
MiniGPT-5新特性发布:Token转化为Voken,新增图文交叉生成功能 AIGC动态欢迎阅读 原标题:野心勃勃的MiniGPT-5出现了!Token变Voken,支持图文交叉生成 关键词:模型、图像、文本、阶段、视觉 文章来源:夕小瑶科技说 内容字数:6092字 内容摘要:夕小瑶科技说 分享来源 | 机器之心大模型正在实现语言和视觉的跨越,有望无缝地理解和生成文本和图像... AI工具箱3年前
美图自研视觉大模型3.0发布:生图“脑补”和精准修图全面进化,100天看得见巨变 <img src=""> AIGC动态 原标题:美图自研视觉大模型3.0发布!实现“脑补”生图和精准修图,全面进化100天 关键词:模型,视觉,工作流,解读,效果 文章来源:AI导航 内容字数:10521字 内容摘要:走向AI视觉大模型的未来:万物皆可生成。作者:Ze... AI工具箱3年前
前百度高管接手亚马逊AWS大中华区;英伟达取消人工智能峰会;华为透露小艺语音转写功能丨人工智能大事日报 <img src=""> 《AIGC大事日报》新闻摘要 近期重要新闻动态: 1. 前百度高管接手AWS大中华区,引起行业关注。 2. 英伟达取消原定的AI峰会,引发讨论。 3. 华为终端BG的CTO李小龙爆料小艺语音转写功能的即将推出,备受瞩目。 其他新闻包括:谷歌前... AI工具箱3年前
MiniGPT-5发布:Token变Voken,文图生成新功能助力创作 AIGC动态欢迎阅读 原标题:统一图像和文字生成的MiniGPT-5来了:Token变Voken,模型不仅能续写,还会自动配图了 关键词:模型、图像、文本、阶段、视觉 文章来源:机器之心 内容字数:6726字 内容摘要:机器之心报道机器之心编辑部OpenAI的GPT-5大型模型似乎还遥遥无期,但已经... AI工具箱3年前
浙大校友开源多模态大模型LLaVA-1.5,130亿参数,用8个A100一天训练完成挑战GPT-4V 最新动态:AIGC 刚刚发布:挑战GPT-4V!浙江大学校友发布开源多模态大型模型 LLaVA-1.5,拥有130亿参数,仅用8个A100在一天内完成训练 关键词:数据,模型,指令,视觉,格式 文章来源:新智元 字数:8754字 摘要:新智元报道编辑:Aeneas。LLaVA-1.5正面挑战GPT-... AI工具箱3年前
微软发布《GPT-4V多模态大模型》166页使用指南,速览简报 AIGC动态欢迎阅读 微软发布了长达166页的多模态大模型GPT-4V使用指南,本文对其进行了速览。 关键词:报告、视觉、能力、图像、解读 文章来源:夕小瑶科技说 本文内容共7737字。 夕小瑶科技说在一周前分享了本文,内容为机器之心的作者陈萍和张倩。ChatGPT最近迎来了重大更新,包括GPT-4... AI工具箱3年前
康奈尔大学研究:小鼠也有VR头显了,开颅探究大脑和行为 这篇文章是关于康奈尔大学的研究者们给小鼠戴上虚拟现实(VR)头显的报道。通过这项沉浸式研究,他们希望了解大脑和行为之间的关系。这篇文章来源于新智元,全文5348字。文章介绍了研究者们为小鼠制造的MouseGoggles虚拟现实头显,并提到了小鼠在接受这种体验前需要进行开颅手术。这表明小鼠也已经进入了... AI工具箱3年前
ICCV’23年度论文颁奖揭晓:Meta分割与ControlNet齐获殊荣,评委惊艳之作浮出水面 本文介绍了2023年ICCV大会的一些重要结果。最佳论文奖颁给了两篇颠覆性的论文,其中之一是"ControlNet",该论文在开源平台GitHub上获得了广泛的关注和赞誉。这篇论文对扩散模型和整个计算机视觉领域都具有重要意义。详情请参阅原文链接。 同时,您也可以联系到作者获取更多... AI工具箱3年前
微软最新发布的166页测评报告:揭秘视觉模态GPT-4V的强大之处 AIGC动态欢迎您的阅读原文标题:微软最新166页测评报告:视觉模态GPT-4V的强大之处如何?关键词:报告、视觉、能力、图像、解读文章来源:创始人公园内容字数:8779字内容摘要:本文来源于机器之心。一周前,ChatGPT迎来了重大更新,无论是GPT-4还是GPT-3.5模型,都能够基于图像进行分... AI工具箱3年前
纽约大学研究揭示智能进展:学会开罐头依靠视觉反馈,成功率提升135%,LeCun点赞 <img src=""> AIGC动态欢迎阅读 原标题:纽约大学最新具身智能进展:机器人通过视觉反馈学会开罐头,任务成功率提高135%,得到LeCun认可 关键词:机器人, 触觉, 视觉, 方法, 任务 文章来源:量子位 内容字数:3202字 内容摘要:最近,来自纽约... AI工具箱3年前
微软发布166页GPT-4V测评报告,业内人士强烈推荐高级用户阅读 最新动态:AIGC专题 原题:微软发布了长达166页的关于GPT-4V的测评报告。业内人士称之为高级用户必读 关键词:报告、视觉能力、图像解读 稿件来源:机器之心 文章字数:8579字 内容摘要:微软发布了一份针对GPT-4V功能的深度研究报告,适合任何有兴趣挖掘GPT-4V潜力的人阅读。ChatG... AI工具箱3年前
多模态大模型的综合审查:从专家级到通用助手 欢迎阅读AIGC动态 这篇文章原题为:《多模态大模型综述:从专家到通用助手》。关键词包括:报告、模型、视觉、作者、微软。文章转载自量子位,Founder Park经过调整。文章全文共5516字,其中详细总结了当前已完善及前沿研究领域中两类多模态大模型的发展方向,并围绕五个具体研究主题展开讨论:视觉理... AI工具箱3年前
探秘微软最新发布的多模态基础模型及其AI代理应用 AIGC动态欢迎阅读 原标题:微软最新发布:从专家到通用AI代理,一文读懂「多模态基础模型」 关键词:模型、视觉、报告、图像、基础 文章来源:人工智能学家 内容字数:7702字 内容摘要:视觉作为人类和其他生物感知世界的主要途径之一。人工智能(AI)的核心愿景之一是开发AI代理,模拟感知并生成视觉信... AI工具箱3年前
KOSMOS-2.5:探索「文本密集图像」的多模态大语言模型 AIGC动态欢迎您的阅读 原标题:文档字数越多,模型越兴奋!KOSMOS-2.5:探索「文本密集图像」的多模态大语言模型 关键词:文本、模型、图像、任务、视觉 文章来源:新智元 文本长度:6086字 内容摘要:新智元报道编辑:LRS 好困【新智元导读】语言本身也是一种视觉信息,多模态大语言模型KOS... AI工具箱3年前
马毅团队新研究:微调多模态大模型导致”灾难性遗忘”,性能显著下降 本文是关于马毅团队最新研究的动态报道。研究指出,微调多模态大语言模型(MLLM)可能导致灾难性遗忘问题,这已成为当前热门话题之一,即使像GPT-4这样的模型也难以避免。最近,来自UC伯克利、NYU等机构的研究人员发现,微调后的多模态大模型可能会遭受灾难性遗忘。他们在论文中探讨了这一问题,并表示这是关... AI工具箱3年前
多模态大模型: 未来人机交互的发展方向? AIGC动态欢迎阅读原标题:多模态大模型会是未来人机交互的方向吗?关键字:模型,语音,信息,用户,视觉文章来源:人工智能学家内容字数:21282字内容摘要:目前市面上的交互产品主要以单模式交互为主,尤其是语音交互。语音产品通常是以语音助手的形态呈现。语音交互相较于按键操作,能够提供更为便捷的体验,尤... AI工具箱3年前
IEEE杰出会员张磊:在手机端实现大模型的普及刻不容缓 AIGC动态欢迎阅读近期IEEE Fellow张磊发表观点称,普及大型模型并在手机端实现创新至关重要。关键词涉及模型、视觉、工业界、科技以及底层。这一信息来自AI科技评论,总字数为13150字。文章内容主要探讨了大型模型规模化部署的挑战和重要性,特别是在手机端创新的影响。2022年底以来,大型模型如... AI工具箱3年前
微软7位研究员合作撰写的多模态大模型全面综述:涵盖5大主题,共计119页 欢迎阅读AIGC动态 原标题:微软7位研究员合作撰写多模态大模型最全综述,涵盖5大主题,共119页内容 关键词:报告、模型、视觉、作者、微软 文章来源:量子位 字数:5098字 内容摘要:此为量子位公众号文章,介绍了由微软7位华人研究员撰写的多模态大模型综述,共计119页。该综述从当前已完善和最前沿... AI工具箱3年前
OpenAI准备对抗谷歌Gemini:推出多模态大模型和新指令语言模型 欢迎阅读AIGC动态 原标题:OpenAI与谷歌Gemini展开激烈竞争:全力推进多模态大模型,并发布新指令语言模型 关键词:报告, 模型, 视觉, 语言, 指令 文章来源:AI前线 文章字数:5863字 文章摘要:经过OpenAI去年底推出ChatGPT引起全球轰动后,该公司一直以惊人的速度发布新... AI工具箱3年前
颜水成与他的学生们:揭秘七次 CV 夺冠背后 AIGC动态欢迎阅读原题目:揭秘七次获得CV冠军的背后:颜水成及其学生们关键词:视觉、团队、卷积、深度、技术文章来源:AI科技评论内容字数:19689字内容摘要:这是一场深度学习浪潮,七次世界冠军,两次跟随者…… 作者:李梅、郭思 编辑:岑峰 他们不仅搭上了人工智能的热潮,更是创造了这场热潮本身。2... AI工具箱3年前
水下探测技术:关键技术与智能装备 <img src=""> 欢迎阅读AIGC动态 原文标题:涉水视觉:从关键技术到智能装备 关键词:视觉、技术、环境、光学、图像 文章来源:机器之心 字数:9731字 摘要:《涉水视觉》一文探讨了光与水的相互作用和跨介质传播机制,介绍了涉水成像和图像解析领域的最新研究进... AI工具箱3年前
RACV2023:大规模模型和ChatGPT对计算机视觉的影响总结 AIGC动态欢迎阅读 原标题:RACV2023观点集锦 | 大模型&ChatGPT对计算机视觉的影响 关键词:模型,视觉,任务,报告,领域 文章来源:夕小瑶科技说 内容字数:53325字 内容摘要:在ChatGPT的大热背景下,大型模型在计算机视觉中的作用,以及如何应用这些大型模型来处理各种... AI工具箱3年前
阿里云AI大模型通用问答千问完成备案,全面开放! 在最新的消息中,阿里云宣布了通义千问大模型已经通过备案,并且正式向公众开放。这一消息意味着该模型将为用户带来更丰富的AI应用体验。此前,百度的“文心一言”、阿里巴巴的“通义千问”以及360的“360智脑”等多款产品已经面世,其中百度的产品已经开始在一些场景得到实际应用。随着ChatGPT在全球范围内... AI工具箱3年前
Meta发布FACET:大规模视觉模型评估基准,DINOv2视觉模型开源商用 AIGC动态欢迎阅读近期,Meta发布了一项重要消息:他们开源了计算机视觉模型DINOv2,并且可以商业化应用了。同时发布了全新的视觉模型评估基准FACET。DINOv2是Meta AI继「分割一切」SAM模型之后发布的另一个重要视觉基础模型。在今年4月份宣布开源时,仅能用于技术研究,而现在在Apa... AI工具箱3年前
字节发布 Vi-PRoM 视觉预训练方案,提高机器人操作成功率和效果 欢迎阅读AIGC动态本文所报道的动态标题为:“字节提出 Vi-PRoM 视觉预训练方案,提高机器人操作成功率和操作效果”。与机器人、视觉、操作、语义和数据相关的关键词被提及。文章来源于机器之心,内容字数为4831字。文章摘要显示,ByteDance Research 团队的研究者在机器人操作能力方面... AI工具箱3年前