Как установить себе на ноутбук локальную модель

Бесплатно6 сентября 2026 г.

📝Содержание урока

Зачем вообще локальная модель

Облачные ИИ (ChatGPT, Claude, Gemini) удобны, но у них три минуса: они платные, требуют интернет и всё, что вы им пишете, уходит на чужие серверы. Локальная модель — это языковая модель, которая работает прямо на вашем компьютере: файл с «мозгами» лежит на диске, считает ваш процессор, интернет не нужен вообще.

Что это даёт на практике:

  • Бесплатно и без лимитов — никакой подписки, можно гонять сколько угодно.

  • Работает офлайн — в поездке, при отключении света, в самолёте.

  • Приватность — можно давать модели тексты с персональными данными клиентов без риска утечки: данные никуда не уходят с ноутбука.

  • Автоматизация через агента — модель можно подключить к агентной программе (Goose), которая сама читает файлы, выполняет команды и делает рутинную работу.

Честно сразу: локальная модель слабее облачных гигантов. Это не «замена ChatGPT», а бесплатный рабочий инструмент для черновиков, разбора текстов и простых автоматизаций. В этом уроке я покажу полный путь: от установки до работающего агента, который читает файлы и делает анализ, — со всеми граблями, на которые я наступил.

Что понадобится

Мой ноутбук — обычная рабочая машина: процессор Intel i7 (4 ядра), 16 ГБ памяти, без дискретной видеокарты. Это важный ориентир: если у вас нет игровой видеокарты — это нормально, модели до 4 миллиардов параметров вполне комфортно считают на процессоре.

Минимальные требования:

  • Процессор — любой современный (Intel Core / AMD Ryzen за последние ~6 лет).

  • Память — от 8 ГБ, комфортно — 16 ГБ. Модель на 3–4 млрд параметров занимает 2–8 ГБ памяти вместе с контекстом.

  • Диск — от 10 ГБ свободного места. Модели весят 1–5 ГБ каждая.

  • Система — Windows, macOS или Linux.

Если ноутбук во время работы модели шумит и греется — это нормально: процессор работает на полную. Для коротких задач (5–10 минут) это безопасно, но тяжёлые модели на слабом железе лучше не гонять долго.

Шаг 1. Устанавливаем Ollama и первую модель

Ollama — это бесплатный «двигатель», который скачивает модели и запускает их на вашем компьютере. Ставится в два клика: скачайте установщик с официального сайта ollama.com и установите как обычную программу. После установки Ollama висит в фоне (иконка ламы рядом с часами) — так и должно быть.

Проверяем, что всё живо, и скачиваем первую модель. Откройте терминал (в Windows — «Терминал» или PowerShell) и введите:

ollama run qwen2.5:3b

Команда скачает модель Qwen 2.5 на 3 млрд параметров (~1,9 ГБ) и запустит чат прямо в терминале. Появится приглашение >>> — пишите вопрос обычным текстом, модель отвечает на этом же экране. Чтобы выйти из чата, наберите /bye.

Список установленных моделей:

ollama list

Шаг 2. Собираем свою версию модели через Model File

У моделей есть настройки, и одна из них критична для агентной работы — контекстное окно (context window): сколько текста модель «видит» одновременно, в токенах (токен — это примерно слово или его часть). По умолчанию Ollama даёт всего ~4 тысячи токенов — об этом ниже, это главная ловушка.

Свою версию модели собирают через Model File — текстовый файл с настройками. Сначала выгружаем исходный:

ollama show qwen2.5:3b --modelfile > Modelfile-qwen2.5-3b.txt

Открываем файл в редакторе и делаем три правки:

  1. В строке FROM меняем технический путь на имя модели: FROM qwen2.5:3b — так подсказывает комментарий в самом файле.

  2. Добавляем PARAMETER num_ctx 32768 — контекст 32 768 токенов.

  3. Добавляем системную инструкцию — постоянное правило поведения модели:

FROM qwen2.5:3b
PARAMETER num_ctx 32768
SYSTEM """Ты — полезный ассистент. Всегда отвечай только на русском языке."""

SYSTEM-строка не украшение: без неё Qwen (китайская модель) отвечает на «привет» по-китайски. Собираем новую модель из файла:

ollama create qwen2.5-3b-32k -f Modelfile-qwen2.5-3b.txt

И проверяем результат — команда ollama show должна показать num_ctx 32768 в секции Parameters и tools в секции Capabilities:

ollama show: параметры новой модели

ollama list: список моделей

Грабли, на которые я наступил

Грабля 1: PowerShell сохраняет файл не в той кодировке. Команда с > в PowerShell пишет файл в кодировке UTF-16, а Ollama её не понимает — Model File «не читается». Решение: откройте файл в VS Code и пересохраните в UTF-8 (справа внизу щёлкните кодировку → «Save with Encoding» → UTF-8).

Грабля 2: модель «не замечает» пересборку. После ollama create старая версия остаётся в памяти ещё ~5 минут и продолжает отвечать по-старому. Лечится выгрузкой:

ollama stop qwen2.5-3b-32k

Шаг 3. Почему агенту нужен большой контекст

Теперь главное открытие этого урока. Когда я подключил модель к агенту (следующий шаг), она «не видела» инструменты: на просьбу прочитать файл отвечала текстом, а то и выдумывала содержимое. Модель казалась тупой — но была невиновна.

Дело в том, что агентная программа перед каждой задачей отправляет модели большой служебный промт: правила поведения и — главное — описания инструментов (прочитать файл, выполнить команду и т.д.). При контексте 4 тысячи токенов этот промт просто обрезается — и модель физически не получает описания инструментов. Она не отказывается ими пользоваться — она про них не знает.

Схема: как обрезается промт агента при малом контексте

Поэтому PARAMETER num_ctx 32768 — не формальность, а условие работы агента. Именно эта строка превратила неработающую модель в работающую.

Шаг 4. Подключаем агента Goose

Goose — бесплатная агентная программа (open source от компании Block): она принимает задачу обычным текстом, разбивает её на шаги и вызывает инструменты — читает файлы, запускает команды, создаёт файлы. Модель «мозгом» она берёт у Ollama — как раз наш случай.

Схема: как связаны агент Goose, Ollama и модель

Скачайте Goose с GitHub (репозиторий block/goose) и распакуйте в удобную папку. Важно: в менеджере пакетов winget есть программа с тем же именем «Goose» — это другая программа для миграции баз данных, она вам не нужна.

Запуск сессии агента (Windows, PowerShell). Сначала переходим в рабочую папку — агент увидит её файлы:

cd D:\Projects\my-ai-work

Затем говорим Goose, какой моделью пользоваться, и запускаем сессию с правилами:

$env:GOOSE_PROVIDER = "ollama"
$env:GOOSE_MODEL = "qwen3-1b-32k"
& "D:\Tools\goose\goose-package\goose.exe" session --system "Для чтения файлов используй ТОЛЬКО инструмент shell (например, команда type reviews.txt). Никогда не используй инструменты edit и text_editor. Всегда отвечай на русском языке."

Три пояснения к этому заклинанию:

  • $env:... — это синтаксис PowerShell для переменных окружения. В старых инструкциях пишут set GOOSE_PROVIDER=... — это синтаксис cmd, в PowerShell он не работает.

  • & "путь" session — амперсанд обязателен, когда путь к программе в кавычках.

  • Флаг --system задаёт модели правила на всю сессию. Это важно: Goose перезаписывает системную инструкцию из Model File своим промтом, поэтому «отвечай на русском» до Goose не доезжает — а через --system доезжает. Туда же полезно вписать правило, какими инструментами пользоваться: маленькие модели иногда выбирают не тот инструмент (например, пытаются «отредактировать» файл вместо того, чтобы его прочитать) — прямое правило это лечит.

Появится баннер «goose is ready» — агент ждёт задачу:

Запуск сессии Goose

Шаг 5. Даём агенту реальную задачу

Для проверки я положил в рабочую папку файл reviews.txt с восемью отзывами клиентов об онлайн-платформе обучения и дал агенту задачу:

В текущей папке есть файл reviews.txt с 8 отзывами клиентов. Используй
инструмент просмотра файлов, чтобы получить СОДЕРЖИМОЕ файла reviews.txt
(не список папки, а текст внутри). Затем проанализируй отзывы: раздели
по тональности (позитив/нейтрал/негатив), напиши, сколько негативных и
по каким причинам, и для каждого негативного отзыва предложи одно
конкретное действие менеджера. Ответь на русском, кратко.

Что произошло дальше — видно в терминале (ниже — стилизованная запись реального прогона):

Терминал: агент читает файл и выдаёт анализ

Обратите внимание на строку ▸ shell / command: type reviews.txt — это агент реально вызвал инструмент, получил содержимое файла и анализировал именно его, а не догадку. Итог: 4 негативных отзыва (наставник не выходит на связь, сайт виснет вечером, нет обратной связи по домашним заданиям, запутанная навигация) — и по каждому предложено действие менеджера. Вся работа — 1–3 минуты, бесплатно, без интернета.

Какую модель брать: честный разбор

Я перебрал несколько моделей, и это было полезнее любой теории:

  • Qwen 2.5 (3B) — отличный вариант для чата: быстрая, говорит по-русски, но инструменты вызывает неаккуратно (ломает аргументы). Для агента не годится.

  • Qwen 3 (4B) — инструменты умеет, но на слабом CPU работает медленно и сильно греет ноутбук. Если у вас мощный процессор или видеокарта — присмотритесь.

  • Qwen 3 (1.7B) + контекст 32k — золотая середина для слабого железа: агент вызывает инструменты корректно, 1–3 минуты на шаг, без перегрева. Мой выбор.

Практический вывод: для чата берите модель побольше (2–4B), для агентной работы — из семейства Qwen 3, даже если она меньше. Умение вызывать инструменты важнее размера. И всегда проверяйте в ollama show, что в Capabilities есть tools.

По качеству тоже честно: 1.7-миллиардная модель отлично справилась с классификацией тональности, но спорный отзыв (наполовину похвала, наполовину жалоба) отнесла к позитивным, а формулировки местами корявые. Локальная модель — это черновик и первый проход: финальное решение за человеком.

Где это реально пригодится вам

  • Черновики и тексты — переписать письмо, сократить описание, составить план: офлайн и без подписки.

  • Разбор текстов — выжимка из длинных документов, ответы на вопросы по своим заметкам (32k токенов — это примерно 30–40 страниц).

  • Тестовые данные — сгенерировать отзывы, обращения, комментарии для проверки интерфейсов своего продукта.

  • Приватные данные — договоры, персональные данные клиентов: всё остаётся на компьютере.

Шпаргалка: все команды урока

# Скачивание и запуск модели
ollama run qwen2.5:3b

# Выгрузка Model File
ollama show qwen2.5:3b --modelfile > Modelfile-qwen2.5-3b.txt

# Сборка своей модели (после правок в файле)
ollama create qwen2.5-3b-32k -f Modelfile-qwen2.5-3b.txt

# Проверка параметров и списка
ollama show qwen2.5-3b-32k
ollama list

# Выгрузить модель из памяти
ollama stop qwen2.5-3b-32k

# Запуск агента (PowerShell)
$env:GOOSE_PROVIDER = "ollama"
$env:GOOSE_MODEL = "qwen3-1b-32k"
& "D:\Tools\goose\goose-package\goose.exe" session --system "правила"

Пробуйте, ломайте и настраивайте под себя — локальная модель прощает эксперименты: испортил, пересобрал за минуту. Если застряли — перечитайте раздел про грабли: с вероятностью 90% ваш случай там.

Описание

Полный путь от установки Ollama до работающего агента, который сам читает файлы и делает анализ: сборка своей версии модели через Model File, контекст 32k, подключение агента Goose — с реальными скриншотами и разбором всех граблей.