Ollama GPU: как проверить, использует ли модель видеокарту
Проверяем Ollama через ollama ps: что означают CPU, GPU и смешанное размещение, где искать причину медленного ответа и как провести сравнение.
Локальный помощник долго разбирает заметки интервью. Первая мысль — Ollama не использует видеокарту. Это возможная причина, но скорость сама по себе её не доказывает: время уходит и на загрузку модели, и на длинный контекст, и на генерацию ответа.
Начни с ollama ps. Команда показывает загруженные модели и их размещение. Ниже разберём, как прочитать вывод и выбрать следующий шаг, не перебирая случайные настройки драйверов.
1. Сначала загрузи именно локальную модель
Проверь список установленных моделей:
ollama ls
Если Ollama ещё не установлена, начни с инструкции установки. Выбери уже скачанную локальную модель, подходящую по памяти компьютеру. Для первого измерения не нужна самая большая модель. Облачный запуск не проверяет локальную видеокарту.
Открой выбранную модель в приложении Ollama и отправь короткий запрос:
Сожми учебную заметку до трёх пунктов. Не добавляй фактов.
Клиент вручную переносит заявки в таблицу. Это занимает около
20 минут утром. Коллега не видит, какие заявки уже обработаны.
Клиент предложил общий статус заявки; решение о разработке не принято.
Во время генерации или сразу после неё в отдельном окне терминала выполни:
ollama ps
Отдельное окно важно: пока первое занято диалогом, команды там могут восприниматься как сообщение модели. Команды списка и управления моделями описаны в CLI Reference Ollama.
Пустой вывод означает, что в данный момент нет загруженной модели. Он не говорит, что видеокарта несовместима или модели не установлены. Повтори запрос и проверь сразу; не делай вывод по списку через час после работы.
2. Прочитай столбец PROCESSOR
Смотри на строку именно той модели, которой отправил запрос. Не сравнивай запись другой модели, оставшейся от соседнего эксперимента.
| Значение PROCESSOR | Что означает | Что не следует из него |
|---|---|---|
100% GPU |
Модель целиком размещена на GPU | Видеокарта постоянно загружена на 100% |
100% CPU |
Модель размещена в системной памяти | Компьютер вообще не имеет видеокарты |
| Сочетание CPU/GPU | Размещение поделено между системной памятью и GPU | Настройка обязательно сломана |
Эти значения объяснены в официальном FAQ. Например, запись с долями CPU и GPU сама по себе не измеряет скорость ответа. Системный монитор решает другую задачу: показывает текущую активность устройств. Низкая активность после завершения ответа естественна.
Размер файла модели на диске тоже не равен всей памяти, необходимой при работе. Контекст и одновременные запросы влияют на потребление. Поэтому «файл меньше памяти видеокарты» — полезная проверка, но недостаточное доказательство, что любой сценарий поместится полностью.
Мой подход: я бы сначала зафиксировал рабочую задачу и приемлемое время ответа. Даже подтверждённый GPU не делает модель полезной, если она теряет факты. А достаточно быстрая небольшая модель может быть хорошим решением без дальнейшей настройки оборудования.
3. Двигайся от наблюдения к причине
Если видишь смешанное размещение, останови другие эксперименты, уменьши объём входного текста и сравни меньшую локальную модель. Меняй один параметр за раз. Большая модель и большой контекст одновременно не позволяют понять, что именно повлияло на результат. Не выгружай чужие рабочие процессы на общем сервере ради теста.
Если видишь только CPU, проверь совместимость видеокарты, операционной системы и установленного драйвера по Hardware support. Требования различаются для NVIDIA, AMD и других вариантов ускорения. Поддержка одного GPU в Linux не гарантирует тот же путь в Windows. На Apple Silicon также не стоит переносить инструкции NVIDIA: там другой механизм ускорения и общая память.
Не начинай с переменных, принудительно подменяющих тип GPU. Сначала выясни, видит ли устройство система и поддерживает ли его текущая версия Ollama. Если проблема появилась после обновления или выхода из сна, запиши этот факт — он помогает отличить нехватку памяти от сбоя обнаружения устройства.
Если Ollama работает в контейнере, проверь, доступен ли GPU самому контейнеру. Видеокарта на хосте и видеокарта внутри контейнера — разные проверки. Сначала локализуй проблему на этом уровне, затем меняй параметры модели.
Для следующего шага нужны логи. В официальной диагностике указаны:
| Среда | Где посмотреть |
|---|---|
| macOS | ~/.ollama/logs/server.log |
| Windows | Папка %LOCALAPPDATA%\Ollama, файл server.log |
| Linux с systemd | Журнал службы Ollama |
| Ручной запуск сервера | Окно терминала с сервером |
Для Linux можно получить последние сообщения без бесконечного ожидания новых строк:
journalctl -u ollama -n 100 --no-pager
Ищи сообщения об обнаружении GPU, доступной памяти и выборе вычислительной библиотеки. Не публикуй весь журнал без просмотра: в нём могут оказаться пути, параметры окружения и фрагменты рабочих данных. Для обращения за помощью обычно достаточно версии Ollama, ОС, модели GPU, тега модели, вывода ollama ps и относящихся к ошибке строк.
4. Проверь пользу на одинаковой задаче
Возьми учебную заметку из начала статьи. Сделай один прогревочный запрос, затем несколько повторов в новых диалогах с тем же текстом. Отдельно зафиксируй первый запуск: в нём могла происходить загрузка модели. Не смешивай время скачивания и время генерации.
| Что записать | Зачем |
|---|---|
| Точный тег модели и версия Ollama | Чтобы повторить сравнение |
| Объём заметки и настройки контекста | Чтобы условия не изменились незаметно |
| PROCESSOR сразу после запроса | Чтобы знать фактическое размещение |
| Время ответа нескольких повторов | Чтобы не опираться на случайный запуск |
| Сохранённые факты и ошибки | Чтобы скорость не подменяла качество |
Ожидаемый смысл ответа на учебный текст: перенос заявок занимает время; коллега не видит статус обработки; общий статус предложен, но разработка не согласована. Если модель превратила предложение в принятое решение, быстрый ответ не прошёл проверку.
Для выбора размера модели используй отдельное руководство. Для решения «оставить локально или использовать облако» сравни весь рабочий процесс по шаблону оценки затрат, включая ручные исправления.
Команды и интерпретация сверены с официальной документацией 23 сентября 2026 года. В рамках подготовки статьи тест производительности на GPU не проводился; численных обещаний ускорения здесь нет. Если строишь помощника вокруг локальной модели, на курсе по ИИ-агентам следующий шаг — связать данные, инструменты и проверку результата.
Собери своего ИИ-агента и проверь результат
«AI Agents: от vibe coding к AI-команде»: desktop agents, MCP, skills, evals и harness. Отдельные воркшопы — от подключения инструментов до контроля качества.
7 практических воркшопов · записи · вопросы автору в чате
Посмотреть программу курса ↗