bythe.net
← К ленте
Новинки

Локальные модели: ИИ на ноутбуке без подписки и без сети

Ollama, LM Studio и llama.cpp запускают открытые языковые модели на обычном компьютере. Что уже работает, чего ждать от железа и где пределы.

Что стало возможно

Ещё пару лет назад запуск языковой модели дома означал видеокарту за тысячи долларов и вечер сборки из исходников. Сейчас это одна команда:

ollama run gemma3

Через минуту в терминале отвечает модель, работающая целиком на вашем процессоре или встроенной графике. Без ключа API, без счётчика токенов, без отправки текста куда-либо.

Кто за этим стоит

llama.cpp — библиотека на C++, которая научилась запускать модели на обычных процессорах и графике Apple, AMD и Intel, а не только NVIDIA. Формат GGUF с квантованием весов сделал модели в несколько раз меньше при небольшой потере качества.

Ollama обернула llama.cpp в удобный сервис: одна команда для загрузки модели, HTTP-API, совместимое с OpenAI, библиотека готовых моделей. Большинство инструментов, которые «поддерживают локальные модели», на деле подключаются к Ollama.

LM Studio — то же самое с графическим интерфейсом для тех, кому ближе окно, а не терминал.

Открытые модели. Llama от Meta, Gemma от Google, Qwen от Alibaba, Mistral, DeepSeek и Phi от Microsoft выпускают веса под лицензиями, разрешающими локальный запуск. Модели на 4–12 миллиардов параметров помещаются в 8–16 гигабайт памяти и уже годятся для многих задач.

Что работает хорошо

  • Суммаризация и переписывание текстов, черновики писем, перевод.
  • Ответы по своим документам: локальный RAG, где ни один файл не покидает машину.
  • Автодополнение кода в редакторе — Zed, VS Code через Continue, JetBrains.
  • Классификация, извлечение данных, разбор логов в пайплайнах, где нельзя отправлять данные наружу.
  • Работа в самолёте, в поле, в закрытом контуре.

Где пределы

Локальная модель на 8 миллиардов параметров — не замена флагманским облачным. Она хуже рассуждает, чаще ошибается в фактах, слабее в длинных многошаговых задачах. Для сложного кода и глубокого анализа облако пока выигрывает с большим отрывом.

Скорость зависит от памяти. Mac с объединённой памятью на 32–64 гигабайта тянет модели среднего размера комфортно. Ноутбук с 16 гигабайтами и без выделенной графики — только маленькие, и небыстро. NVIDIA остаётся самым быстрым вариантом, но требует отдельной видеокарты с достаточным объёмом памяти.

Куда это идёт

Производители чипов закладывают нейроускорители в каждый новый процессор, а операционные системы встраивают модели в себя. Модели становятся эффективнее на каждый гигабайт. Разрыв между «локально» и «в облаке» не исчезнет, но для всё большего числа задач локального будет достаточно.

Если у вас современный ноутбук, попробуйте: установка занимает пять минут, а понимание, что модель может, а что нет, стоит дороже любой статьи.

Войти, чтобы оценить материал

Комментарии

Войти, чтобы оставить комментарий