AI.Product ClubБлог Михаила Карпова
← Все материалы
HOW-TOПамять и локальный ИИ6 мин чтения

Ollama GPU: как проверить, использует ли модель видеокарту

Проверяем Ollama через ollama ps: что означают CPU, GPU и смешанное размещение, где искать причину медленного ответа и как провести сравнение.

Локальный помощник долго разбирает заметки интервью. Первая мысль — Ollama не использует видеокарту. Это возможная причина, но скорость сама по себе её не доказывает: время уходит и на загрузку модели, и на длинный контекст, и на генерацию ответа.

Начни с ollama ps. Команда показывает загруженные модели и их размещение. Ниже разберём, как прочитать вывод и выбрать следующий шаг, не перебирая случайные настройки драйверов.

Как читать ollama ps: пустой список требует запуска модели, GPU означает размещение, смешанный режим требует проверки памяти, CPU — проверки совместимости и логов
Авторская схема AI Product Club. Процент в PROCESSOR описывает размещение модели, а не текущую загрузку вычислителя.

1. Сначала загрузи именно локальную модель

Проверь список установленных моделей:

ollama ls

Если Ollama ещё не установлена, начни с инструкции установки. Выбери уже скачанную локальную модель, подходящую по памяти компьютеру. Для первого измерения не нужна самая большая модель. Облачный запуск не проверяет локальную видеокарту.

Открой выбранную модель в приложении Ollama и отправь короткий запрос:

Сожми учебную заметку до трёх пунктов. Не добавляй фактов.
Клиент вручную переносит заявки в таблицу. Это занимает около
20 минут утром. Коллега не видит, какие заявки уже обработаны.
Клиент предложил общий статус заявки; решение о разработке не принято.

Во время генерации или сразу после неё в отдельном окне терминала выполни:

ollama ps

Отдельное окно важно: пока первое занято диалогом, команды там могут восприниматься как сообщение модели. Команды списка и управления моделями описаны в CLI Reference Ollama.

Пустой вывод означает, что в данный момент нет загруженной модели. Он не говорит, что видеокарта несовместима или модели не установлены. Повтори запрос и проверь сразу; не делай вывод по списку через час после работы.

2. Прочитай столбец PROCESSOR

Смотри на строку именно той модели, которой отправил запрос. Не сравнивай запись другой модели, оставшейся от соседнего эксперимента.

Значение PROCESSOR Что означает Что не следует из него
100% GPU Модель целиком размещена на GPU Видеокарта постоянно загружена на 100%
100% CPU Модель размещена в системной памяти Компьютер вообще не имеет видеокарты
Сочетание CPU/GPU Размещение поделено между системной памятью и GPU Настройка обязательно сломана

Эти значения объяснены в официальном FAQ. Например, запись с долями CPU и GPU сама по себе не измеряет скорость ответа. Системный монитор решает другую задачу: показывает текущую активность устройств. Низкая активность после завершения ответа естественна.

Размер файла модели на диске тоже не равен всей памяти, необходимой при работе. Контекст и одновременные запросы влияют на потребление. Поэтому «файл меньше памяти видеокарты» — полезная проверка, но недостаточное доказательство, что любой сценарий поместится полностью.

Мой подход: я бы сначала зафиксировал рабочую задачу и приемлемое время ответа. Даже подтверждённый GPU не делает модель полезной, если она теряет факты. А достаточно быстрая небольшая модель может быть хорошим решением без дальнейшей настройки оборудования.

3. Двигайся от наблюдения к причине

Если видишь смешанное размещение, останови другие эксперименты, уменьши объём входного текста и сравни меньшую локальную модель. Меняй один параметр за раз. Большая модель и большой контекст одновременно не позволяют понять, что именно повлияло на результат. Не выгружай чужие рабочие процессы на общем сервере ради теста.

Если видишь только CPU, проверь совместимость видеокарты, операционной системы и установленного драйвера по Hardware support. Требования различаются для NVIDIA, AMD и других вариантов ускорения. Поддержка одного GPU в Linux не гарантирует тот же путь в Windows. На Apple Silicon также не стоит переносить инструкции NVIDIA: там другой механизм ускорения и общая память.

Не начинай с переменных, принудительно подменяющих тип GPU. Сначала выясни, видит ли устройство система и поддерживает ли его текущая версия Ollama. Если проблема появилась после обновления или выхода из сна, запиши этот факт — он помогает отличить нехватку памяти от сбоя обнаружения устройства.

Если Ollama работает в контейнере, проверь, доступен ли GPU самому контейнеру. Видеокарта на хосте и видеокарта внутри контейнера — разные проверки. Сначала локализуй проблему на этом уровне, затем меняй параметры модели.

Для следующего шага нужны логи. В официальной диагностике указаны:

Среда Где посмотреть
macOS ~/.ollama/logs/server.log
Windows Папка %LOCALAPPDATA%\Ollama, файл server.log
Linux с systemd Журнал службы Ollama
Ручной запуск сервера Окно терминала с сервером

Для Linux можно получить последние сообщения без бесконечного ожидания новых строк:

journalctl -u ollama -n 100 --no-pager

Ищи сообщения об обнаружении GPU, доступной памяти и выборе вычислительной библиотеки. Не публикуй весь журнал без просмотра: в нём могут оказаться пути, параметры окружения и фрагменты рабочих данных. Для обращения за помощью обычно достаточно версии Ollama, ОС, модели GPU, тега модели, вывода ollama ps и относящихся к ошибке строк.

4. Проверь пользу на одинаковой задаче

Возьми учебную заметку из начала статьи. Сделай один прогревочный запрос, затем несколько повторов в новых диалогах с тем же текстом. Отдельно зафиксируй первый запуск: в нём могла происходить загрузка модели. Не смешивай время скачивания и время генерации.

Что записать Зачем
Точный тег модели и версия Ollama Чтобы повторить сравнение
Объём заметки и настройки контекста Чтобы условия не изменились незаметно
PROCESSOR сразу после запроса Чтобы знать фактическое размещение
Время ответа нескольких повторов Чтобы не опираться на случайный запуск
Сохранённые факты и ошибки Чтобы скорость не подменяла качество

Ожидаемый смысл ответа на учебный текст: перенос заявок занимает время; коллега не видит статус обработки; общий статус предложен, но разработка не согласована. Если модель превратила предложение в принятое решение, быстрый ответ не прошёл проверку.

Для выбора размера модели используй отдельное руководство. Для решения «оставить локально или использовать облако» сравни весь рабочий процесс по шаблону оценки затрат, включая ручные исправления.

Команды и интерпретация сверены с официальной документацией 23 сентября 2026 года. В рамках подготовки статьи тест производительности на GPU не проводился; численных обещаний ускорения здесь нет. Если строишь помощника вокруг локальной модели, на курсе по ИИ-агентам следующий шаг — связать данные, инструменты и проверку результата.

Todo: попробуй на своей задачеПрогресс сохраняется в этом браузере.
ПРАКТИКА НА КУРСЕ / AI PRODUCT CLUB

Собери своего ИИ-агента и проверь результат

«AI Agents: от vibe coding к AI-команде»: desktop agents, MCP, skills, evals и harness. Отдельные воркшопы — от подключения инструментов до контроля качества.

7 практических воркшопов · записи · вопросы автору в чате

Посмотреть программу курса ↗

Автор: — практик автоматизации и автор курсов AI Product Club.