Локальная нейросеть у вас на компьютере
Открытые модели запускаются на обычном ПК и не отправляют данные никуда. Цена — качество ниже старших облачных моделей и ограничение по памяти видеокарты.
Что запустится на вашем железе
| Память видеокарты / ОЗУ | Размер модели | Что получите |
|---|---|---|
| без видеокарты, 16 ГБ ОЗУ | 1,5–4 млрд параметров | медленно, простые задачи |
| 8 ГБ видеопамяти | 7–8 млрд в 4 битах | приличный чат, база знаний |
| 16–24 ГБ | 14–32 млрд в 4 битах | близко к облачным по бытовым задачам |
| Mac с 32+ ГБ единой памяти | до 30–70 млрд | лучший вариант для ноутбука |
Инструменты
Ollama
Одна команда — модель скачана и запущена. Есть API для своих программ.
LM Studio
Окно с чатом, выбор моделей, локальный сервер. Для тех, кто не любит терминал.
Open WebUI / AnythingLLM
Интерфейс поверх Ollama с базой знаний по вашим документам.
ComfyUI / Fooocus
Локальная генерация картинок и запуск своих LoRA.
Локальная модель под ваши данные
Установите Ollama или LM Studio
Windows, macOS, Linux; ставится как обычная программа.
Скачайте модель под память
Qwen или Gemma подходящего размера в 4-битной версии (GGUF).
Добавьте инструкцию
Modelfile в Ollama или системная инструкция в LM Studio — роль, правила, формат.
Подключите документы
AnythingLLM или Open WebUI: папка с файлами превращается в базу знаний.
Дообучите, если нужно
LoRA через Unsloth на своих примерах, экспорт в GGUF — и модель с вашим стилем работает локально.
Честно про предел
Локальная модель на 7–8 миллиардов параметров заметно слабее старших облачных: хуже рассуждает, чаще ошибается в длинных задачах, не умеет искать в интернете и запускать код. Для чата по документам и типовых текстов её хватает; для сложных многошаговых задач — нет.
Поэтому разумная схема: локально — то, что нельзя отправлять наружу; остальное — облачные модели или агент, который сам подбирает модель под шаг.
Подобрать локальную модель и настроить под данные
Скажите, какой у вас компьютер и какие данные, — агент подберёт модель, напишет установку и инструкцию, подготовит базу знаний.
Поставить задачу →Частые вопросы
Нужна ли видеокарта?
Желательна: без неё модели до 4 миллиардов работают на процессоре, медленно. Mac с единой памятью — исключение.
Локальная модель понимает русский?
Qwen и Gemma — хорошо; Llama — заметно хуже.
Можно ли дообучить локальную модель?
Да, LoRA через Unsloth на своей видеокарте или в бесплатном Colab, затем экспорт в GGUF и запуск в Ollama.