Локальные модели: ИИ на ноутбуке без подписки и без сети
Ollama, LM Studio и llama.cpp запускают открытые языковые модели на обычном компьютере. Что уже работает, чего ждать от железа и где пределы.
Что стало возможно
Ещё пару лет назад запуск языковой модели дома означал видеокарту за тысячи долларов и вечер сборки из исходников. Сейчас это одна команда:
ollama run gemma3
Через минуту в терминале отвечает модель, работающая целиком на вашем процессоре или встроенной графике. Без ключа API, без счётчика токенов, без отправки текста куда-либо.
Кто за этим стоит
llama.cpp — библиотека на C++, которая научилась запускать модели на обычных процессорах и графике Apple, AMD и Intel, а не только NVIDIA. Формат GGUF с квантованием весов сделал модели в несколько раз меньше при небольшой потере качества.
Ollama обернула llama.cpp в удобный сервис: одна команда для загрузки модели, HTTP-API, совместимое с OpenAI, библиотека готовых моделей. Большинство инструментов, которые «поддерживают локальные модели», на деле подключаются к Ollama.
LM Studio — то же самое с графическим интерфейсом для тех, кому ближе окно, а не терминал.
Открытые модели. Llama от Meta, Gemma от Google, Qwen от Alibaba, Mistral, DeepSeek и Phi от Microsoft выпускают веса под лицензиями, разрешающими локальный запуск. Модели на 4–12 миллиардов параметров помещаются в 8–16 гигабайт памяти и уже годятся для многих задач.
Что работает хорошо
- Суммаризация и переписывание текстов, черновики писем, перевод.
- Ответы по своим документам: локальный RAG, где ни один файл не покидает машину.
- Автодополнение кода в редакторе — Zed, VS Code через Continue, JetBrains.
- Классификация, извлечение данных, разбор логов в пайплайнах, где нельзя отправлять данные наружу.
- Работа в самолёте, в поле, в закрытом контуре.
Где пределы
Локальная модель на 8 миллиардов параметров — не замена флагманским облачным. Она хуже рассуждает, чаще ошибается в фактах, слабее в длинных многошаговых задачах. Для сложного кода и глубокого анализа облако пока выигрывает с большим отрывом.
Скорость зависит от памяти. Mac с объединённой памятью на 32–64 гигабайта тянет модели среднего размера комфортно. Ноутбук с 16 гигабайтами и без выделенной графики — только маленькие, и небыстро. NVIDIA остаётся самым быстрым вариантом, но требует отдельной видеокарты с достаточным объёмом памяти.
Куда это идёт
Производители чипов закладывают нейроускорители в каждый новый процессор, а операционные системы встраивают модели в себя. Модели становятся эффективнее на каждый гигабайт. Разрыв между «локально» и «в облаке» не исчезнет, но для всё большего числа задач локального будет достаточно.
Если у вас современный ноутбук, попробуйте: установка занимает пять минут, а понимание, что модель может, а что нет, стоит дороже любой статьи.
Войти, чтобы оценить материал
Комментарии
Войти, чтобы оставить комментарий