InternLMlmdeploy:大模型部署工具包
InternLM/lmdeploy:大模型部署工具包
lmdeploy 在 GitHub 上已经拿到 7,847 Star 了。
上海人工智能实验室开源了这个工具,专门用于大语言模型的压缩、部署与服务,支持主流大模型和多模态模型,提供两种推理引擎适配不同使用需求。
1、核心功能是什么
lmdeploy 主要解决大模型部署过程中的性能与易用性问题,核心功能覆盖四个方面。
推理性能优化,通过持续批处理、块KV缓存、动态拆分融合、张量并行、高性能CUDA内核等技术,请求吞吐量比vLLM最高高1.8倍。
量化支持,支持权重量化和KV缓存量化,4bit推理性能比FP16高2.4倍,量化质量通过OpenCompass评估验证。
分布式服务部署,内置请求分发服务,可快速实现多机多卡环境下的多模型服务部署。
兼容性强,可同时启用KV缓存量化、AWQ和自动前缀缓存三种特性,无需额外适配。

2、技术架构特点
lmdeploy 开发了两个推理引擎,分别适配不同场景需求。
TurboMind引擎追求推理性能的极致优化,支持NVIDIA V100及以上显卡的MXFP4格式,在H800上运行gpt-oss模型时,性能是vLLM的1.5倍。
PyTorch引擎完全使用Python开发,降低开发者使用门槛,支持华为昇腾平台,启用CUDA图后Llama3-8B推理速度提升1.3倍。
支持的模型覆盖主流大模型和多模态模型,包括Llama系列、InternLM系列、Qwen系列、DeepSeek系列、LLaVA系列、InternVL系列等上百种模型,用户可根据需求选择对应引擎。

3、安装与使用
推荐在conda环境中使用pip安装,Python版本要求3.10到3.13:
conda create -n lmdeploy python=3.12 -y
conda activate lmdeploy
pip install lmdeploy
默认预编译包基于CUDA 12编译,GeForce RTX 50系列显卡需要安装CUDA 12.8编译的版本。
离线批量推理使用方式简单,几行代码即可完成:
import lmdeploy
with lmdeploy.pipeline("internlm/internlm3-8b-instruct") as pipe:
response = pipe(["Hi, pls intro yourself", "Shanghai is"])
print(response)
默认从HuggingFace下载模型,可通过设置环境变量切换为ModelScope或openMind Hub源。
4、适用场景
- 需要部署大模型推理服务,追求高吞吐量和低延迟的开发者
- 做RAG系统,需要高效处理大模型推理请求的团队
- 研究大模型量化、推理优化技术的研究人员
- 希望快速验证大模型落地效果的产品开发人员
开源地址:https://github.com/InternLM/lmdeploy
大模型落地效果的产品开发人员
开源地址:https://github.com/InternLM/lmdeploy
更多推荐


所有评论(0)