Skip to main content

A lightweight, effective and easy-to-extend inference runtime

Project description

xlite logo

Xlite轻量化推理运行时

介绍

xlite (GVirt前端):轻量级Transformer模型运行时,支持多样性算力协同,当前支持在昇腾硬件上高效运行。 xlite公开了Transformer运行所需的模型构图以及算子,所有算子基于昇腾AscendC/CCE开发。

背景与动机

在大模型推理场景中,传统的单流串行执行模式存在以下问题:

  • 核间负载不均:不同AICORE之间的任务分配不均衡,部分核心闲置
  • 资源浪费多:计算资源和传输资源利用率低,存在显著浪费
  • 执行时间长:Host CPU下发算子开销大,造成严重的host bond问题

xlite通过以下技术手段解决上述问题:

  • 多流并行:充分利用卡内资源,将单流串行改为多流并行执行
  • 核间负载均衡:核间负载均衡,提升资源利用率
  • CPU NPU协同:C++侧完全消除Python的GC、线程等干扰,简化Host tiling计算,去除小块内存申请释放及拷贝,消除Host bond

性能效果显著:

在GLM-4.7双机推理场景(40K输入、1K输出、prefix cache命中率约90%)下:

  • TPOT时延降低17%~30%
  • 吞吐提升13%~41%

详细性能数据参考 PR #7935

软件架构

image

xlite已适配vllm_ascend,可通过xlite_graph_config配置快速使能xlite加速效果,使用方法参考官方指导文档

xlite支持模型见模型列表

快速开始

安装

# 安装vllm_ascend, 可参考https://github.com/vllm-project/vllm-ascend/blob/main/README.md
# 安装xlite
pip install xlite --extra-index https://download.pytorch.org/whl/cpu/

离线推理示例

import os
from vllm import LLM

# xlite默认支持decode-only模式, 可通过设置 "full_mode": True 使能full模式
model = LLM(model="path/to/Qwen3-32B", tensor_parallel_size=8, additional_config={"xlite_graph_config": {"enabled": True, "full_mode": True}})
outputs = model.generate("Hello, how are you?")

在线服务示例

vllm serve path/to/Qwen3-32B --tensor-parallel-size 8 --additional-config='{"xlite_graph_config": {"enabled": true, "full_mode": true}}'

开发指南

编译构建、容器镜像、源码安装等开发相关内容,请参考 开发指南

环境变量

xlite使用的环境变量及其配置方法,请参考 环境变量

目录结构

.
├── csrc/    - 轻量化运行时的核心代码
├── xlite/   - python代码,包括tools等
├── doc/     - 相关文档介绍
├── docker/  - 容器镜像Dockerfile
└── tests/   - 测试用例

致谢

本项目的核心算子初始版本和思路来自于华为终端小艺AI Infra团队的贡献,相关优化实现可参考论文:

《XY-Serve: End-to-End Versatile Production Serving for Dynamic LLM Workloads》 [ASPLOS 2026]

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

xlite-0.1.0rc12.tar.gz (205.7 kB view details)

Uploaded Source

Built Distributions

If you're not sure about the file name format, learn more about wheel file names.

xlite-0.1.0rc12-cp312-cp312-manylinux2014_aarch64.whl (838.7 kB view details)

Uploaded CPython 3.12

xlite-0.1.0rc12-cp311-cp311-manylinux2014_aarch64.whl (821.6 kB view details)

Uploaded CPython 3.11

File details

Details for the file xlite-0.1.0rc12.tar.gz.

File metadata

  • Download URL: xlite-0.1.0rc12.tar.gz
  • Upload date:
  • Size: 205.7 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.2.0 CPython/3.11.11

File hashes

Hashes for xlite-0.1.0rc12.tar.gz
Algorithm Hash digest
SHA256 15cc2725dbe821bf7c728300b6b3b5dfa8c1ae691af32a62c16d983dd2c48bd9
MD5 dcf9a3106f053f50e54e22cb80b65e34
BLAKE2b-256 e86cc4acf9680ee2c8647694e4ce8682dc7064f508ac641177396a3a18aebda5

See more details on using hashes here.

File details

Details for the file xlite-0.1.0rc12-cp312-cp312-manylinux2014_aarch64.whl.

File metadata

File hashes

Hashes for xlite-0.1.0rc12-cp312-cp312-manylinux2014_aarch64.whl
Algorithm Hash digest
SHA256 b816d37257b132a8c0604885bbe99184d65ce1aaa91571d5166d97ee5bef4546
MD5 11d4fe3c212f9de74a7ed891a7227bcf
BLAKE2b-256 9a14c5265815981e61aa3b8ab508a1e300e7fba847f2fc20db630e56b6023b2d

See more details on using hashes here.

File details

Details for the file xlite-0.1.0rc12-cp311-cp311-manylinux2014_aarch64.whl.

File metadata

File hashes

Hashes for xlite-0.1.0rc12-cp311-cp311-manylinux2014_aarch64.whl
Algorithm Hash digest
SHA256 cccb74688f6acb9cc219290c3a04b6005b81dba941b9d63c79bd52d02854fc8a
MD5 9664f4c84060e558acacec359bd86200
BLAKE2b-256 823b920f7309f5963655e14a685fe9f3d88e014e24024bd2de03167ea7012199

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page