ローカルLLM(mlx / mlx-vlm / llama.cpp / vLLM / SGLang)を OpenAI 互換 API で束ねるマルチモデルゲートウェイ(サーバー)。gateway.toml のカタログを 1 ポートで配信し、model で振り分け・遅延起動・LRU 退避・MTP 高速化(Ollama 流の共有デーモン)。接続用クライアントは別パッケージ local-llm-client。
| # | Наименование новости | Тональность | Информативность | Дата публикации |
|---|---|---|---|---|
| 1 | omnicall-llm-caller 1.0.7 | 0 | 5 | 20-07-2026 |
| 2 | Я устал писать одноразовые скрипты для бенчмарков LLM и собрал харнесс, который сам считает Pareto-front | 0 | 7 | 27-06-2026 |
| 3 | Как мы заставили vLLM «лениться» под нагрузкой и спасли Time-to-First-Token | 0 | 10.92 | 26-04-2026 |
| 4 | LseKit-SequentialThinking 1.2.1 | 0 | 5 | 20-07-2026 |
| 5 | btech-agent-lab 1.14.0 | 0 | 5 | 20-07-2026 |
| 6 | How I'm Solving Local Inference | 0 | 10.4 | 19-06-2026 |
| 7 | Открытые LLM в продакшене: 8 выводов о llama.cpp, Gemma и Qwen | 0 | 7 | 14-07-2026 |
| 8 | Lokale KI auf dem Laptop: So gut funktioniert LM Studio im Alltag | 0 | 5 | 04-07-2026 |
| 9 | fpf-thinking-map 1.4.15 | 0 | 5 | 10-07-2026 |
| 10 | В чём реальная проблема ЛЛМ | -5 | 7 | 03-07-2026 |