语义

共 15 篇文章

NeurIPS 2023|美图&国科大基于文生图模型提出新方法EI² 有效提升视频编辑一致性

本文介绍了美图影像研究院(MT Lab)与中国科学院大学合作提出的基于文生图模型的视频生成新方法EI²,旨在提高视频编辑过程中的语义和内容一致性。文章指出现有视频编辑过程中存在的不一致性问题,主要由引入的时序信息学习模块导致特征空间的协变量偏移,针对此问题设计了新的网络模块以生成高质量的编辑结果。该...
NeurIPS 2023|美图&国科大基于文生图模型提出新方法EI² 有效提升视频编辑一致性

阿里文生视频挑战Gen-2、Pika,1280×720高清画质流畅播放,3500万像素呈现文本与视频绝佳效果

AIGC动态欢迎阅读 近日,阿里巴巴的研究掀起了文生视频领域的新热潮。一项名为I2VGen-XL的文生视频模型展示了惊人的表现,能够以1280×720分辨率高质量、流畅地生成各类视频,包括艺术画作、人物肖像、动物、科幻图等。其中包含了一些示例文本:“一只小猫在花丛中,中国画。”、“一个黄色的机器人。...
阿里文生视频挑战Gen-2、Pika,1280×720高清画质流畅播放,3500万像素呈现文本与视频绝佳效果

后期强化!照片替换视频主角,动作再大也OK|Meta&新加坡国立大学

本文为转载自量子位的文章,介绍了一种名为“VideoSwap”的视频编辑模型,可以通过一张图片替换视频主角,效果十分流畅。该模型能够保持物体之间轨迹的一致性,即使替换前后的物体形状有较大差异也能实现完美替换。与谷歌早前发布的类似技术相比,这一技术的进步可见肉眼可见。文章提到该模型是如何实现这一功能的...
后期强化!照片替换视频主角,动作再大也OK|Meta&新加坡国立大学

浙大等研究提出C-MCR:连接多模态对比表征无需配对数据|NeurIPS 2023

本文介绍了浙江大学等机构研究人员提出的一种名为C-MCR的新型多模态对比表征学习方法,旨在解决多模态学习中依赖配对数据的问题。该方法称为连接多模态对比表示(C-MCR),能够在缺乏配对数据的情况下,高效地训练多模态对比表征。通过将不同模态的输入编码到一个共享的语义空间中,C-MCR连接了不同对比表征...
浙大等研究提出C-MCR:连接多模态对比表征无需配对数据|NeurIPS 2023

港大推出强大的开源推荐系统新工具RLMRec,结合大模型技术,精准提炼用户和商品文本画像

近期港大发布了开源推荐系统新范式RLMRec,该系统结合了大语言模型的特点,能够更准确地提取用户和商品的文本画像。这一新的表征学习范式被成功应用于图神经网络的协同过滤推荐算法中,显著提高了推荐系统在推荐场景下的性能。传统的基于图神经网络的推荐算法主要依赖于ID数据构建的结构化拓扑信息,而忽视了推荐数...
港大推出强大的开源推荐系统新工具RLMRec,结合大模型技术,精准提炼用户和商品文本画像

浙大团队斩获唯一最佳论文奖,三项大奖落入中国团队之手!ACM MultiMedia 2023揭晓盛况

本文报道了2023 ACM MultiMedia会议上中国团队取得的三项大奖,展示了中国在多媒体领域的新突破。其中,浙江大学团队、南京航空航天大学团队和清华大学团队的成果在3072篇投稿中脱颖而出,分别荣获最佳论文奖(Best Paper Award)和荣誉提名奖。此次会议录用了902篇论文,录用率...
浙大团队斩获唯一最佳论文奖,三项大奖落入中国团队之手!ACM MultiMedia 2023揭晓盛况

CTO曝光:GPT-4V自动驾驶五连测大揭秘

文章介绍了图森中国CTO王乃岩在知乎上发表的关于GPT-4V在自动驾驶中的初步探索,引起了广泛关注。经过多方测试后,王乃岩表示他们对GPT-4V的表现感到“大大震惊”。文章指出,GPT-4V的推出为人工智能领域带来了新的可能性,尤其在视觉相关功能方面有了重大突破。作者强调了GPT在图像感知方面的惊人...
CTO曝光:GPT-4V自动驾驶五连测大揭秘

无边界的奇幻3D城市创造者

AIGC动态欢迎参阅近日,南洋理工大学S-Lab的研究人员提出了一个名为CityDreamer的新框架,专注于生成无边界的3D城市。这一创新在机器之心专栏中得到了详细报道。尽管近年来关于3D自然场景的研究已经很多,但关于3D城市生成的研究相对较少。这是因为3D城市生成具有更高难度,人类对其中结构失真...
无边界的奇幻3D城市创造者

AI 语言模型能更好地模拟人类精神吗?最新研究揭晓

AIGC动态欢迎阅读 原文标题:AI 语言模型能更好地分析精神症状的最新研究 关键词:精神症状、患者、语义、模型、认知 文章来源:人工智能学家 文章篇幅:6857字 内容摘要:良好的精神健康对整体健康和幸福至关重要。在昨天(10月10日)世界精神卫生日的相关博客中,世界卫生组织(WHO)指出:全球每...
AI 语言模型能更好地模拟人类精神吗?最新研究揭晓

智源发布3亿条语义向量模型训练数据,BGE模型持续迭代更新

AIGC动态欢迎阅读 原标题:智源开放3亿条语义向量模型训练数据,BGE模型持续迭代更新 关键词:报告,模型,向量,数据,语义 文章来源:机器之心 内容字数:3223字 内容摘要:随着大型模型的热门开发和应用,Embedding作为重要组成部分的重要性日益凸显。智源不久前发布了开源的可商用中英文语义...
智源发布3亿条语义向量模型训练数据,BGE模型持续迭代更新

字节发布 Vi-PRoM 视觉预训练方案,提高机器人操作成功率和效果

欢迎阅读AIGC动态本文所报道的动态标题为:“字节提出 Vi-PRoM 视觉预训练方案,提高机器人操作成功率和操作效果”。与机器人、视觉、操作、语义和数据相关的关键词被提及。文章来源于机器之心,内容字数为4831字。文章摘要显示,ByteDance Research 团队的研究者在机器人操作能力方面...
字节发布 Vi-PRoM 视觉预训练方案,提高机器人操作成功率和效果