DeepSpeed团队发布FastGen:动态SplitFuse技术降低LLM生成延迟50%,有效吞吐量提升2.3倍

DeepSpeed团队发布FastGen:动态SplitFuse技术降低LLM生成延迟50%,有效吞吐量提升2.3倍

AIGC动态欢迎阅读

近日,DeepSpeed团队发布了FastGen技术,通过动态SplitFuse技术成功降低了LLM生成的延迟,提升了2.3倍的有效吞吐量。这一技术突破对于吞吐量、提示、模型系统的优化具有重要意义。

DeepSpeed团队发布FastGen:动态SplitFuse技术降低LLM生成延迟50%,有效吞吐量提升2.3倍

据报道,DeepSpeed-FastGen结合MII和DeepSpeed-Inference实现了LLM高吞吐量文本生成。当前,诸如GPT-4和LLaMA等大型语言模型已成为集成AI的主流服务应用,涵盖常规模型、文档摘要、自动驾驶以及各种软件中的Copilot功能,这些模型的应用需求正迅速增长。

尽管DeepSpeed、PyTorch等框架在LLM训练中表现出色,但当涉及用户交互和开放式文本生成等任务时,由于这些操作的计算密集度较低,现有系统在推理吞吐量上面临瓶颈。针对这一问题,类似vLLM这样由PagedAttention驱动的框架或者Orca系统可显著提高LLM推理性能。然而,面对长提示等工作负载时,这些系统仍难以提供高品质的服务。

对于更多关于LLM生成延迟降低50%、FastGen技术动态SplitFuse技术的内容,欢迎阅读原文:LLM生成延迟降低50%!DeepSpeed团队发布FastGen:动态SplitFuse技术,提升2.3倍有效吞吐量。

联系作者

文章来源:新智元

作者微信:AI_era

作者简介:智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。专注于人工智能、机器人等前沿领域的发展,探讨人机融合、人工智能和机器人对人类社会与文明进化的影响,引领中国智能时代的发展。

分享到: 文章二维码
© 版权声明

相关文章

暂无评论

暂无评论...