Skip to main content

ローカルLLM(mlx / mlx-vlm / llama.cpp / vLLM / SGLang)を OpenAI 互換 API で束ねるマルチモデルゲートウェイ(サーバー)。gateway.toml のカタログを 1 ポートで配信し、model で振り分け・遅延起動・LRU 退避・MTP 高速化(Ollama 流の共有デーモン)。接続用クライアントは別パッケージ local-llm-client。

Project description

local-llm-server

ローカルLLM(mlx / mlx-vlm / llama.cpp)と音声認識(whisper / STT)を束ねる マルチモデルゲートウェイ。1 プロセス起動するだけで、1 つの公開ポートに複数モデルを配信する。 モデルの事前登録は不要——クライアントが指定した model をその場でロードする。 特徴の全体像は docs/features.md

インストール

uv を使う。一度入れればどこからでも gw

git clone https://github.com/ToPo-ToPo-ToPo/local-llm-server
cd local-llm-server
make install       # `gw` を PATH に導入(~/.local/bin/gw)
source ~/.zshrc    # PATH を今のシェルに反映(または新しいターミナルを開く)

~/.local/bin が PATH に無いと警告されたら uv tool update-shell を一度実行してから source ~/.zshrc する。アンインストールは make uninstall(→ docs/operation.md)。

使い方

gw start      # 裏で常駐起動(初回は設定を自動生成)
gw status     # 稼働/停止・PID・URL・起動経過を表示
gw list       # 使えるモデル一覧(カタログ+HF キャッシュ)
gw stop       # 停止

設定は ~/.config/local-llm-server/gateway.toml の 1 箇所(初回の gw start が自動生成。 → docs/gateway.md)。

接続は公開ポート(既定 http://127.0.0.1:8799/v1)に繋いで model を選ぶだけ。 接続クライアントは別パッケージ local-llm-client:

from local_llm_client import LLMClient

llm = LLMClient(model="ToPo-ToPo/Qwen3.6-27B-mlx-4bit",
                base_url="http://127.0.0.1:8799/v1")
print(llm.respond("ローカルLLMの利点を3つ。"))

ドキュメント

ライセンス

Apache-2.0

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

local_llm_server-0.35.0.tar.gz (160.3 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

local_llm_server-0.35.0-py3-none-any.whl (116.6 kB view details)

Uploaded Python 3

File details

Details for the file local_llm_server-0.35.0.tar.gz.

File metadata

  • Download URL: local_llm_server-0.35.0.tar.gz
  • Upload date:
  • Size: 160.3 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.2.0 CPython/3.13.10

File hashes

Hashes for local_llm_server-0.35.0.tar.gz
Algorithm Hash digest
SHA256 3a9e5ed89afe52bfb85ced9f7d6aa5c885579b7668f7183e33a6a7fb9ce9c32f
MD5 7429a44db3f7b5a5ca3941d1b015461a
BLAKE2b-256 3094f8a46fa164d2e955050900d23fb30a6646907e561c2395af4d2f4d699a2f

See more details on using hashes here.

File details

Details for the file local_llm_server-0.35.0-py3-none-any.whl.

File metadata

File hashes

Hashes for local_llm_server-0.35.0-py3-none-any.whl
Algorithm Hash digest
SHA256 cd47e3cb97e9092f03f4186bb8e7e1eea00342977ae043f46b19357edd305b35
MD5 4fd2513773008012ecd29457b5ab8e16
BLAKE2b-256 fce689ebe431b1ef3a3222d082f6e01d2d8837aa6a9f9ae3acad463f86b62a67

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page