Команда LM Studio представила версию 0.4.0, которая переводит продукт из категории десктопных приложений для локальных языковых моделей в полноценную серверную платформу инференса. Обновление затрагивает архитектуру, API и обработку запросов, позволяя использовать LM Studio в headless-режиме, на серверах, в облаке и в CI-пайплайнах без графического интерфейса.
Подробнее о LM Studio 0.4.0
Главное новшество — серверное ядро llmster, работающее независимо от пользовательского интерфейса. Это позволяет запускать модели локально на Linux, в облаке или на любом GPU, полностью отделяя вычислительную часть от десктопного клиента.
Команда для запуска серверного ядра llmster. Источник: .
Параллельные запросы с непрерывной пакетной обработкой заменяют классическую очередь, повышая пропускную способность и снижая простой оборудования. Новый REST API с эндпоинтом /v1/chat поддерживает отслеживание состояния диалогов и интеграцию с локальными MCP, делая платформу удобной для агентных и инструментальных сценариев.
Интеграция с локальными MCP в LM Studio 0.4.0. Источник: .
Десктопное приложение тоже получило обновления: разделенный экран, режим разработчика, встроенная документация и возможность экспорта чатов. UI теперь выступает скорее как клиент к серверному ядру, а не как монолитное приложение.
Выводы
Релиз LM Studio 0.4.0 формально превращает продукт в универсальный инфраструктурный инструмент для развертывания ИИ на серверах. Поддержка headless-режима, параллельного инференса и расширенного API позволяет использовать LM Studio как основу для локальных агентных систем и серверного инференса, закрывая нишу между простыми десктопными клиентами и тяжелыми серверными решениями.
Отделение серверного ядра от UI логично для серверов, но для обычного пользователя это означает, что десктопное приложение становится просто клиентом, который может не запуститься, если ядро уже занято другим процессом.
Serverflow
Да, в такой архитектуре действительно появляется зависимость от внешнего серверного процесса, что может усложнить диагностику для пользователя, привыкшего к монолитному запуску.
Ирина
01.02.2026
Непрерывная пакетная обработка вместо очереди действительно повышает утилизацию GPU, но как при этом регулируется задержка для первого токена, когда одновременно приходит много коротких запросов?
Serverflow
Это хороший вопрос, и он напрямую связан с тем, как именно lm_studio реализует внутреннее планирование пакетов. В статье не приводится деталей по алгоритму выбора пакета, но это действительно компромисс между пропускной способностью и задержкой.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.