Claude 200K产品性能被严重「虚标」?1016美元实测后性能暴跌至90K 本文为《新智元》报道的一篇关于Claude 2.1模型的文章。根据报道,该模型在上下文长度达到90K后表现出明显的性能下降。此前有人投入1016美元测试后发现这一现象。与OpenAI不同,竞争对手Anthropic发布了支持200K上下文的Claude 2.1,它将原本强大的100K上下文能力提升了... AI工具箱3年前
GPT4 Turbo的128K上下文实用性存疑?专家投入巨资评测,斯坦福论文提供支持 本文来自夕小瑶科技说,最近AI圈子里最受关注的话题之一是OpenAI在首届开发者日推出了GPT-4的加强版GPT-4 Turbo。GPT-4 Turbo带来了诸多升级,其中最引人注目的是上下文长度增至128K,相比GPT-4的32K上下文长度,提升了四倍。对于GPT-4 Turbo的这一升级,有人质... AI工具箱3年前
百川智能发布192K参数的Baichuan2大模型,拥有全球最长上下文窗口 AIGC动态欢迎您的阅读 本文内容来自Founder Park,转自新智元。10月30日,百川智能发布了Baichuan2-192K大模型,其上下文窗口长度高达192K,是目前全球最长的上下文窗口。这个模型的文本长度相当于约35万个汉字,打破了Claude一直保持的上下文窗口记录。Baichuan2... AI工具箱3年前
百川智能新品发布:Baichuan2-192K上下文窗口最长,一次超越Claude2输入35万字 AIGC动态欢迎阅读 本文转载自量子位,原标题为:“百川智能推出全球最长上下文窗口大模型Baichuan2-192K,一次可输入35万字超越Claude2”。文章介绍了新发布的Baichuan2-192K大模型,其上下文窗口长度达到192K,是目前全球最长的上下文窗口之一。Baichuan2-192... AI工具箱3年前
百川智能最新产品Baichuan2-192K发布,拥有全球最长上下文窗口!一次读完《三体》,实现7项SOTA突破 本文报告了百川智能发布的Baichuan2-192K大模型,其上下文窗口长度达到了192K,比Claude 2的4.4倍,比GPT-4的14倍,创下了全球最长的上下文窗口长度。该模型提供了一个新的标杆,为长上下文窗口领域带来了重大突破。如果您想深入了解详细内容,请阅读完整报道。 AI工具箱3年前
陈丹琦高徒与Meta合作,推出新方法增强大模型记忆力 本文介绍了一项关于利用4k窗口长度的大模型读取长文本的新方法。由普林斯顿的华人博士生团队开发的MemWalker树形记忆策略能够突破模型窗口长度限制,使模型可以阅读超过1.2万个token的长文本。这一方法不仅可以回答各种问题,而且只需通过prompt就可以完成整个实现过程,无需额外训练。源自《量子... AI工具箱3年前
LLaMA2模型上下文长度扩展至100万tokens,仅需调整一个超参数|复旦邱锡鹏团队力作 AI 前沿信息 原标题:复旦邱锡鹏团队调整一个超参数,LLaMA2上下文长度达100万tokens 关键词:模型、长度、位置、底数、上下文 文章来源:量子位 字数:5019 字 内容摘要:最新研究发现,只需微调一个超参数,LLaMA 2 模型上支持的上下文长度从1.6 万 tokens 延长至 10... AI工具箱3年前
抛弃「浪费」GPU,FlashAttention重磅升级,长文本推理速度提升8倍 在机器之心报道中,编辑部使用大型模型处理长文本,面临着速度挑战。最新的FlashAttention技术通过"Flash-Decoding"方法,充分利用GPU,可以将大模型的长上下文推理速度提高至8倍。近期大型语言模型(LLM)如ChatGPT和Llama备受关注,但其运行成本仍... AI工具箱3年前
MITAI解密:两行神奇代码让您轻松读完《三体》! 近日,夕小瑶科技发表了一篇题为“一键读完《三体》!港中文联MITAI遗忘魔咒,2行代码引领超长文本!”的文章。该文讨论了使用MITAI技术消除大型语言模型在处理超长文本时的困难。传统大语言模型对话存在的缺陷得到了解决,使得处理长文本不再是问题。文章指出,之前使用大型语言模型时,由于模型处理能力受限,... AI工具箱3年前
AI 天才杨植麟发布长模型产品,特点:长长长长长 <img src=""> AI模型革新:杨植麟打造超长文本产品 原标题:AI 天才杨植麟推出长篇大作 关键词:模型、上下文、清华、文本长度 文章来源:量子位 文章字数:8018字 内容摘要:杨植麟推出的万字级大模型产品支持长达20万字的文本输入,堪称全球最长。此举刷新... AI工具箱3年前
LLaMA2上下文扩展至100k:MIT和港中文引入LongLoRA方法 欢迎阅读AIGC动态 原标题:MIT和香港中文学院的研究者开发出了名为LongLoRA的方法,将LLaMA2模型的上下文扩展至100k 关键词:上下文、模型、研究者、长度、长上 文章来源:机器之心 内容字数:6020字 内容摘要:机器之心报道,编辑部成功扩展了大型模型的上下文长度,无需消耗过多计算资... AI工具箱3年前
大规模模型在长序列上的关键挑战 欢迎阅读AIGC动态原标题:探讨大型模型在处理长上下文时的关键问题关键词:上下文、数据、长度、注意力、模型本文内容摘要来自人工智能学家,文章字数达到20128字。长上下文语言模型的发展成为LLM领域的一大亮点。在过去的一年中,出现了几种处理长上下文的语言模型,比如GPT-4(32k上下文)、Mosa... AI工具箱3年前
DeepMind新技术将ReLU替代softmax,为视觉Transformer带来成本降低效益 在这篇文章中,《视觉Transformer中ReLU替代softmax,DeepMind新招让成本速降》介绍了Google DeepMind团队在Transformer架构中采用ReLU替代softmax以降低成本的最新研究成果。在现代机器学习领域,Transformer架构得到了广泛应用,其中的注... AI工具箱3年前