英伟达近日发布了新版AI加速库TensorRT-LLM,该版本针对大语言模型推理进行了深度优化,在多种主流GPU上的推理性能较上一代提升了数倍,并新增了对最新架构模型的支持。
新版库通过内核融合、KV缓存管理等技术,显著降低了显存占用和延迟,使得在单张消费级显卡上运行百亿参数模型成为可能。英伟达表示,该更新将加速生成式AI应用在云、数据中心及边缘端的部署。
英伟达近日发布了新版AI加速库TensorRT-LLM,该版本针对大语言模型推理进行了深度优化,在多种主流GPU上的推理性能较上一代提升了数倍,并新增了对最新架构模型的支持。
新版库通过内核融合、KV缓存管理等技术,显著降低了显存占用和延迟,使得在单张消费级显卡上运行百亿参数模型成为可能。英伟达表示,该更新将加速生成式AI应用在云、数据中心及边缘端的部署。