Top.Mail.Ru
Ollama v0.12: запуск облачных LLM в локальном приложении | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

Ollama v0.12: запуск облачных LLM в локальном приложении

~ 2 мин
1422
Простой
Новости
Ollama v0.12: запуск облачных LLM в локальном приложении

Введение

Приложение Ollama обновилось до новой версии v0.12, в которой добавили функцию предварительного просмотра работоспособности ИИ-моделей в режиме реального времени без необходимости локальной установки.

Подробнее о Ollama v0.12

Благодаря новой функции, пользователи, не имеющие доступа к высокопроизводительным графическим ускорителям, могут запускать большие языковые модели с полным объемом параметров в облачном режиме, тестируя их производительность, скорость генерации и другие передовые возможности. При этом, разработчики Ollama заявляют, что все пользовательские данные будут оставаться конфиденциальными даже при работе в облачном режиме, а производительность ничем не будет отличаться от локального инференса. Облачные модели Ollama также работают через API, совместимый с OpenAI. Пока что для облачного запуска доступны только 4 модели: qwen3-coder:480b-cloud, gpt-oss:120b-cloud, gpt-oss:20b-cloud и deepseek-v3.1:671b-cloud, однако в будущем разработчики обещают расширить пул совместимых LLM. С руководством по скачиванию Ollama v0.12 можно ознакомиться на официальном сайте Ollama.

Выводы

Движок инференса Ollama активно развивается и всего за пару месяцев разработчики выпустили несколько версий приложения Ollama, в которых появились новые, инновационные функции. Скорее всего, в будущем пул возможностей Ollama увеличится еще больше, что позволит платформе лучше закрепиться на позиции самого популярного движка локального запуска больших языковых моделей.
Автор: Serverflow Serverflow
Поделиться

Комментарии 1

Написать комментарий
Константин
Вы пишете, что производительность в облаке ничем не отличается от локального инференса. Но как это возможно, если облачные модели вроде qwen3-coder:480b-cloud имеют 480 миллиардов параметров, и их явно запускают на чужих GPU, а не на вашем железе? Похоже на маркетинговое обещание, которое сложно проверить, пока не увидишь реальные цифры задержек.
Serverflow
Вы правы, здесь возможны нюансы. Мы опираемся на официальные заявления Ollama, но на практике задержки могут зависеть от сети и загрузки серверов, поэтому идеальной идентичности добиться сложно.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)