Зачем вообще локальная модель
Облачные ИИ (ChatGPT, Claude, Gemini) удобны, но у них три минуса: они платные, требуют интернет и всё, что вы им пишете, уходит на чужие серверы. Локальная модель — это языковая модель, которая работает прямо на вашем компьютере: файл с «мозгами» лежит на диске, считает ваш процессор, интернет не нужен вообще.
Что это даёт на практике:
Бесплатно и без лимитов — никакой подписки, можно гонять сколько угодно.
Работает офлайн — в поездке, при отключении света, в самолёте.
Приватность — можно давать модели тексты с персональными данными клиентов без риска утечки: данные никуда не уходят с ноутбука.
Автоматизация через агента — модель можно подключить к агентной программе (Goose), которая сама читает файлы, выполняет команды и делает рутинную работу.
Честно сразу: локальная модель слабее облачных гигантов. Это не «замена ChatGPT», а бесплатный рабочий инструмент для черновиков, разбора текстов и простых автоматизаций. В этом уроке я покажу полный путь: от установки до работающего агента, который читает файлы и делает анализ, — со всеми граблями, на которые я наступил.
Что понадобится
Мой ноутбук — обычная рабочая машина: процессор Intel i7 (4 ядра), 16 ГБ памяти, без дискретной видеокарты. Это важный ориентир: если у вас нет игровой видеокарты — это нормально, модели до 4 миллиардов параметров вполне комфортно считают на процессоре.
Минимальные требования:
Процессор — любой современный (Intel Core / AMD Ryzen за последние ~6 лет).
Память — от 8 ГБ, комфортно — 16 ГБ. Модель на 3–4 млрд параметров занимает 2–8 ГБ памяти вместе с контекстом.
Диск — от 10 ГБ свободного места. Модели весят 1–5 ГБ каждая.
Система — Windows, macOS или Linux.
Если ноутбук во время работы модели шумит и греется — это нормально: процессор работает на полную. Для коротких задач (5–10 минут) это безопасно, но тяжёлые модели на слабом железе лучше не гонять долго.
Шаг 1. Устанавливаем Ollama и первую модель
Ollama — это бесплатный «двигатель», который скачивает модели и запускает их на вашем компьютере. Ставится в два клика: скачайте установщик с официального сайта ollama.com и установите как обычную программу. После установки Ollama висит в фоне (иконка ламы рядом с часами) — так и должно быть.
Проверяем, что всё живо, и скачиваем первую модель. Откройте терминал (в Windows — «Терминал» или PowerShell) и введите:
ollama run qwen2.5:3bКоманда скачает модель Qwen 2.5 на 3 млрд параметров (~1,9 ГБ) и запустит чат прямо в терминале. Появится приглашение >>> — пишите вопрос обычным текстом, модель отвечает на этом же экране. Чтобы выйти из чата, наберите /bye.
Список установленных моделей:
ollama listШаг 2. Собираем свою версию модели через Model File
У моделей есть настройки, и одна из них критична для агентной работы — контекстное окно (context window): сколько текста модель «видит» одновременно, в токенах (токен — это примерно слово или его часть). По умолчанию Ollama даёт всего ~4 тысячи токенов — об этом ниже, это главная ловушка.
Свою версию модели собирают через Model File — текстовый файл с настройками. Сначала выгружаем исходный:
ollama show qwen2.5:3b --modelfile > Modelfile-qwen2.5-3b.txtОткрываем файл в редакторе и делаем три правки:
В строке
FROMменяем технический путь на имя модели:FROM qwen2.5:3b— так подсказывает комментарий в самом файле.Добавляем
PARAMETER num_ctx 32768— контекст 32 768 токенов.Добавляем системную инструкцию — постоянное правило поведения модели:
FROM qwen2.5:3b
PARAMETER num_ctx 32768
SYSTEM """Ты — полезный ассистент. Всегда отвечай только на русском языке."""SYSTEM-строка не украшение: без неё Qwen (китайская модель) отвечает на «привет» по-китайски. Собираем новую модель из файла:
ollama create qwen2.5-3b-32k -f Modelfile-qwen2.5-3b.txtИ проверяем результат — команда ollama show должна показать num_ctx 32768 в секции Parameters и tools в секции Capabilities:


Грабли, на которые я наступил
Грабля 1: PowerShell сохраняет файл не в той кодировке. Команда с > в PowerShell пишет файл в кодировке UTF-16, а Ollama её не понимает — Model File «не читается». Решение: откройте файл в VS Code и пересохраните в UTF-8 (справа внизу щёлкните кодировку → «Save with Encoding» → UTF-8).
Грабля 2: модель «не замечает» пересборку. После ollama create старая версия остаётся в памяти ещё ~5 минут и продолжает отвечать по-старому. Лечится выгрузкой:
ollama stop qwen2.5-3b-32kШаг 3. Почему агенту нужен большой контекст
Теперь главное открытие этого урока. Когда я подключил модель к агенту (следующий шаг), она «не видела» инструменты: на просьбу прочитать файл отвечала текстом, а то и выдумывала содержимое. Модель казалась тупой — но была невиновна.
Дело в том, что агентная программа перед каждой задачей отправляет модели большой служебный промт: правила поведения и — главное — описания инструментов (прочитать файл, выполнить команду и т.д.). При контексте 4 тысячи токенов этот промт просто обрезается — и модель физически не получает описания инструментов. Она не отказывается ими пользоваться — она про них не знает.

Поэтому PARAMETER num_ctx 32768 — не формальность, а условие работы агента. Именно эта строка превратила неработающую модель в работающую.
Шаг 4. Подключаем агента Goose
Goose — бесплатная агентная программа (open source от компании Block): она принимает задачу обычным текстом, разбивает её на шаги и вызывает инструменты — читает файлы, запускает команды, создаёт файлы. Модель «мозгом» она берёт у Ollama — как раз наш случай.

Скачайте Goose с GitHub (репозиторий block/goose) и распакуйте в удобную папку. Важно: в менеджере пакетов winget есть программа с тем же именем «Goose» — это другая программа для миграции баз данных, она вам не нужна.
Запуск сессии агента (Windows, PowerShell). Сначала переходим в рабочую папку — агент увидит её файлы:
cd D:\Projects\my-ai-workЗатем говорим Goose, какой моделью пользоваться, и запускаем сессию с правилами:
$env:GOOSE_PROVIDER = "ollama"
$env:GOOSE_MODEL = "qwen3-1b-32k"
& "D:\Tools\goose\goose-package\goose.exe" session --system "Для чтения файлов используй ТОЛЬКО инструмент shell (например, команда type reviews.txt). Никогда не используй инструменты edit и text_editor. Всегда отвечай на русском языке."Три пояснения к этому заклинанию:
$env:...— это синтаксис PowerShell для переменных окружения. В старых инструкциях пишутset GOOSE_PROVIDER=...— это синтаксис cmd, в PowerShell он не работает.& "путь" session— амперсанд обязателен, когда путь к программе в кавычках.Флаг
--systemзадаёт модели правила на всю сессию. Это важно: Goose перезаписывает системную инструкцию из Model File своим промтом, поэтому «отвечай на русском» до Goose не доезжает — а через--systemдоезжает. Туда же полезно вписать правило, какими инструментами пользоваться: маленькие модели иногда выбирают не тот инструмент (например, пытаются «отредактировать» файл вместо того, чтобы его прочитать) — прямое правило это лечит.
Появится баннер «goose is ready» — агент ждёт задачу:

Шаг 5. Даём агенту реальную задачу
Для проверки я положил в рабочую папку файл reviews.txt с восемью отзывами клиентов об онлайн-платформе обучения и дал агенту задачу:
В текущей папке есть файл reviews.txt с 8 отзывами клиентов. Используй
инструмент просмотра файлов, чтобы получить СОДЕРЖИМОЕ файла reviews.txt
(не список папки, а текст внутри). Затем проанализируй отзывы: раздели
по тональности (позитив/нейтрал/негатив), напиши, сколько негативных и
по каким причинам, и для каждого негативного отзыва предложи одно
конкретное действие менеджера. Ответь на русском, кратко.Что произошло дальше — видно в терминале (ниже — стилизованная запись реального прогона):

Обратите внимание на строку ▸ shell / command: type reviews.txt — это агент реально вызвал инструмент, получил содержимое файла и анализировал именно его, а не догадку. Итог: 4 негативных отзыва (наставник не выходит на связь, сайт виснет вечером, нет обратной связи по домашним заданиям, запутанная навигация) — и по каждому предложено действие менеджера. Вся работа — 1–3 минуты, бесплатно, без интернета.
Какую модель брать: честный разбор
Я перебрал несколько моделей, и это было полезнее любой теории:
Qwen 2.5 (3B) — отличный вариант для чата: быстрая, говорит по-русски, но инструменты вызывает неаккуратно (ломает аргументы). Для агента не годится.
Qwen 3 (4B) — инструменты умеет, но на слабом CPU работает медленно и сильно греет ноутбук. Если у вас мощный процессор или видеокарта — присмотритесь.
Qwen 3 (1.7B) + контекст 32k — золотая середина для слабого железа: агент вызывает инструменты корректно, 1–3 минуты на шаг, без перегрева. Мой выбор.
Практический вывод: для чата берите модель побольше (2–4B), для агентной работы — из семейства Qwen 3, даже если она меньше. Умение вызывать инструменты важнее размера. И всегда проверяйте в ollama show, что в Capabilities есть tools.
По качеству тоже честно: 1.7-миллиардная модель отлично справилась с классификацией тональности, но спорный отзыв (наполовину похвала, наполовину жалоба) отнесла к позитивным, а формулировки местами корявые. Локальная модель — это черновик и первый проход: финальное решение за человеком.
Где это реально пригодится вам
Черновики и тексты — переписать письмо, сократить описание, составить план: офлайн и без подписки.
Разбор текстов — выжимка из длинных документов, ответы на вопросы по своим заметкам (32k токенов — это примерно 30–40 страниц).
Тестовые данные — сгенерировать отзывы, обращения, комментарии для проверки интерфейсов своего продукта.
Приватные данные — договоры, персональные данные клиентов: всё остаётся на компьютере.
Шпаргалка: все команды урока
# Скачивание и запуск модели
ollama run qwen2.5:3b
# Выгрузка Model File
ollama show qwen2.5:3b --modelfile > Modelfile-qwen2.5-3b.txt
# Сборка своей модели (после правок в файле)
ollama create qwen2.5-3b-32k -f Modelfile-qwen2.5-3b.txt
# Проверка параметров и списка
ollama show qwen2.5-3b-32k
ollama list
# Выгрузить модель из памяти
ollama stop qwen2.5-3b-32k
# Запуск агента (PowerShell)
$env:GOOSE_PROVIDER = "ollama"
$env:GOOSE_MODEL = "qwen3-1b-32k"
& "D:\Tools\goose\goose-package\goose.exe" session --system "правила"Пробуйте, ломайте и настраивайте под себя — локальная модель прощает эксперименты: испортил, пересобрал за минуту. Если застряли — перечитайте раздел про грабли: с вероятностью 90% ваш случай там.