EMBA reunion · 10 октября 2026

Локальный ИИ
от первого запуска до команды

Локальный ИИ: памятка для слушателей

По итогам обсуждения на реюнионе ЕМБА 10 октября 2026 года.

Если вы хотите работать со своими документами внутри личного или корпоративного контура, можно развернуть модель у себя. В качестве ориентира возьмём Qwen3.8-27B. Это модель для текста, кода и изображений. Локальный запуск означает, что сама модель работает на вашем компьютере или сервере. Чтобы данные действительно оставались внутри контура, интерфейс, хранение файлов и подключённые инструменты тоже должны быть настроены соответствующим образом.


Как читать: выберите личный или корпоративный маршрут. Цены и нагрузку проверяйте перед закупкой: это ориентиры на 11 октября 2026 года, а не коммерческое предложение.


Первый раз здесь? Начните со сборки, каталоги можно прочитать позже.

Как пройти по картинкам: у каждого шага переключайте «До шага → Сделайте → Получится». Оранжевая рамка показывает место действия; зелёная отметка — пример ожидаемого результата. Это учебные схемы, а не снимки вашей установленной программы. Кнопка «Увеличить» раскрывает схему. На кадре «Сделайте» автоматически открываются точные команды и ссылки; полный текст доступен в «Полная инструкция и помощь». Переключение кадров ничего не устанавливает: действия выполняйте в указанной программе, затем сравнивайте результат.

Здесь мы собираем один учебный комплект. Сначала появится чат, затем агент научится читать два файла и создавать третий. Покупать и устанавливать все программы из каталогов не нужно.

Семь слов, которые встретятся дальше
Слово Что это в нашей сборке Что появляется у вас
Модель Qwen: вычисляет ответ на переданный текст Большой скачанный файл; сам по себе не открывает чат
Движок / сервер модели llama.cpp на Mac или vLLM на NVIDIA: запускает модель Работающая программа, которая принимает запросы
Чат Окно для переписки с моделью Страница в браузере
API / Base URL Адрес для связи двух программ Строка настройки, например адрес с /v1; это не страница чата
Харнес Программа, которая даёт модели инструменты и выполняет её шаги В учебном примере — OpenCode в отдельной вкладке Терминала
Инструмент / MCP Инструмент читает файл или открывает сайт; MCP подключает дополнительные инструменты Видимый вызов действия и его результат в истории агента
Skill / навык Сохранённый порядок выполнения задачи Маленький файл SKILL.md; сам программы не устанавливает

Q8 GGUF и FP8 — разные форматы хранения модели для разных программ запуска. В учебных шагах уже выбран нужный файл: пересчитывать и выбирать формат самостоятельно не требуется.

1. Для себя

1.1. Базовый стек

Что понадобится

Вариант из занятия — стационарный ПК с доработанной RTX 4090 на 48 ГБ видеопамяти и 48–64 ГБ оперативной памяти. Это специальная конфигурация: у обычной RTX 4090 — 24 ГБ видеопамяти ↗. Другой вариант — Mac mini с M4 Pro и 48 ГБ объединённой памяти ↗ или MacBook Pro с M5 Pro/M5 Max и 48 ГБ ↗. MacBook удобен, если модель нужна в поездках; Mac mini — для постоянного рабочего места.

Практический результат ведущего: на его RTX 4090, доработанной до 48 ГБ, Qwen3.8-27B обслуживала до 15 одновременных запросов. Исследование скорости работы Qwen3.8-27B ↗. Это результат конкретного стенда; в памятке не зафиксированы формат весов, длина запросов и время ожидания. При выборе другого оборудования и нагрузки эти параметры измеряют заново.

Как запустить

Для NVIDIA с 48 ГБ видеопамяти основной вариант — Qwen3.8-27B-FP8 ↗ через vLLM ↗. Для Mac mini / MacBook с 48 ГБ объединённой памяти начните с Q8 GGUF ↗ через llama.cpp ↗: это простой воспроизводимый маршрут для локального чата. Затем можно сравнить MLX 8-bit ↗, сборку под Apple Silicon. Q8 занимает около 29 ГБ, BF16 — около 54 ГБ ещё до расхода памяти на контекст и программу; на 48 ГБ BF16 целиком не помещается. Q4 оставьте для устройств с меньшим запасом памяти или когда важнее скорость, чем точность.

Что можно делать

Вести диалог, готовить черновики писем и документов, разбирать тексты, помогать себе с кодом. Для работы с папками и корпоративными материалами понадобится дополнительный интерфейс и настройка доступа. Модель сама по себе не получает доступ к вашим файлам и не запоминает их навсегда после разговора.

Границы

Локальная модель может уступать самым сильным облачным моделям в сложной инженерной работе. Она не знает свежие новости без подключённого источника данных. Большие документы и длинные рассуждения требуют больше памяти и времени. Поэтому сначала проверьте качество именно на своих типовых задачах.

Основной маршрут этой памятки

Mac 48 ГБ → Q8 GGUF + llama.cpp; NVIDIA 48 ГБ → FP8 + vLLM

MacBook и Mac mini используют одну инструкцию ниже. Для ПК с NVIDIA есть отдельная краткая инструкция. Начальный результат — текстовый чат; картинки, документы и агент подключаются после проверки базы.

Для первого запуска: переходите к сборке, затем к агенту. Каталоги выше нужны, если вы хотите сравнить альтернативы.


1.2. Модели и программы

Основной маршрут на Mac: Qwen3.8-27B Q8 GGUF + llama.cpp; на NVIDIA: Qwen3.8-27B FP8 + vLLM. Для уже имеющегося ноутбука с 16–24 ГБ можно отдельно попробовать Qwen3.5-9B через Ollama; покупать устройство из сметы для этой пробы не требуется.

Модель — это файл с обученными весами. Обвязка — программа, которая его запускает и даёт окно для работы. Открытые веса можно скачать, но правила использования зависят от лицензии. Наличие файла модели само по себе не даёт чат, поиск по документам или права доступа.

1. Выберите модель

Четыре понятных кандидата для старта. Это подборка для сравнения на ваших задачах, а не рейтинг всех существующих моделей. B означает миллиарды параметров, а не гигабайты памяти.

Лёгкий старт

Qwen3.5 · 9B
Иллюстрация Qwen3.5 · 9B от разработчика или из каталога Ollama

Текст, код и изображения. Кандидат для первых опытов на ноутбуке; проверьте на своих письмах, таблицах и сканах.

Планируйте 16–24 ГБ памяти устройства для пробного запуска с коротким контекстом. Это ориентир, а не минимальное требование.

Лицензия весов: Apache 2.0

Карточка разработчика и файлы ↗ · Взять в Ollama ↗

Какой файл или команду выбрать: ollama run qwen3.5:9b

Команда выполняется в терминале после установки Ollama. Первая загрузка требует интернета; затем модель можно запускать локально.

Основная модель памятки

Qwen3.8 · 27B
Иллюстрация Qwen3.8 · 27B от разработчика или из каталога Ollama

Текст, код, изображения и многошаговые задачи. Подходит как кандидат для домашней станции и корпоративного пилота.

Для Q8 на Mac и FP8 на NVIDIA ориентир памятки — 48 ГБ памяти соответствующего типа. Ограничивайте контекст по фактическому расходу памяти.

Лицензия весов: Apache 2.0

Исходная модель ↗ · FP8 для NVIDIA ↗ · Q8 GGUF для Mac ↗ · MLX 8-bit для Mac ↗

Что выбрать: на Mac — Qwen3.8-27B-Q8_0.gguf; на NVIDIA — vllm serve Qwen/Qwen3.8-27B-FP8 после установки vLLM.

Сборка GGUF опубликована командой ggml-org. Для картинок также нужен совместимый mmproj из этого репозитория; поддержка зависит от версии приложения. FP8 — тоже снижение точности весов до 8 бит, а не исходная BF16; по памяти и точности это другой класс, чем Q4.

Текст + картинки

Gemma 3 · 12B IT
Иллюстрация Gemma 3 · 12B IT от разработчика или из каталога Ollama

Модель Google для диалога, кратких изложений и разбора изображений. Вариант для сравнения качества с Qwen на одной подборке задач.

Для старта в Q4 планируйте 16–24 ГБ памяти. Длинные документы и изображения увеличивают расход.

Лицензия весов: Gemma Terms

Карточка разработчика и файлы ↗ · Взять в Ollama ↗

Какой файл или команду выбрать: ollama run gemma3:12b

Команда выполняется в терминале после установки Ollama. Первая загрузка требует интернета; затем модель можно запускать локально.

Рассуждения и код

gpt-oss · 20B
Иллюстрация gpt-oss · 20B от разработчика или из каталога Ollama

Текстовая модель OpenAI для рассуждений, программирования и работы с инструментами. Изображения напрямую не принимает.

Разработчик указывает запуск в 16 ГБ памяти с MXFP4. Для компьютера с ОС и другими приложениями нужен запас.

Лицензия весов: Apache 2.0

Карточка разработчика и файлы ↗ · Взять в Ollama ↗

Какой файл или команду выбрать: ollama run gpt-oss:20b

Команда выполняется в терминале после установки Ollama. Первая загрузка требует интернета; затем модель можно запускать локально.

Как понимать память. Q4 — веса около 4 бит, FP8 и Q8 — около 8 бит, BF16 — 16 бит. Размер скачанного файла меньше общего расхода памяти: дополнительно нужны контекст, изображения и программа. У Apple используется объединённая память; у ПК важны отдельно RAM и видеопамять. Начните с короткого диалога. Если памяти не хватает, уменьшите контекст или выберите меньшую модель.

2. Выберите обвязку

В инструкции для Mac ниже используется llama.cpp. Если хотите приложение с кнопками, LM Studio — отдельная альтернатива со своей инструкцией в карточке. Для NVIDIA используется vLLM. При смене движка следуйте его инструкции, а не командам llama-server.

МОДЕЛЬ → LM Studio → ЧАТ

Приложение для себя

LM Studio

Поиск и загрузка моделей, обычный чат и работа с документами в одном окне. Удобный первый маршрут для Mac, Windows и Linux.

Установить → Discover → найти модель → Download → Chat → Load. На Mac с 48 ГБ выбирайте совместимую сборку Q8.

Готовое приложение; условия использования LM Studio.

Скачать приложение ↗ · Инструкция ↗

Запуск моделей и API

Ollama
Ollama — изображение из официального источника

Загружает модели из каталога и запускает их локально. К нему можно подключить общий веб-чат. Есть приложение и команды для терминала.

Установить → выбрать локальную модель → выполнить команду из карточки выше. Модели с суффиксом :cloud работают в облаке.

Исходный код Ollama — MIT; у каждой модели своя лицензия.

Скачать Ollama ↗ · Каталог моделей ↗

GGUF → llama.cpp → ЧАТ

Движок для GGUF

llama.cpp

Запускает GGUF на процессоре и совместимых GPU. Встроенный llama-server даёт API и веб-чат. Для тех, кому нужен контроль настроек.

Скачать сборку для своей ОС → выбрать GGUF → запустить llama-server. Для изображений может потребоваться отдельный файл mmproj.

Открытый код, MIT.

Скачать готовую сборку ↗ · Инструкция сервера ↗

3. Скачайте и проверьте

1Источник

Откройте карточку разработчика. В Hugging Face файлы находятся на вкладке Files and versions; в Ollama используйте точное имя и размер модели.

2Совместимый формат

Для llama.cpp — GGUF. Для LM Studio — поддерживаемая сборка из поиска приложения. Для vLLM — веса и рецепт запуска из карточки модели; GGUF не универсален.

3Пробный результат

Задайте одинаковые вопросы двум моделям. Проверьте русский язык, ответы по документу и скорость. Затем отключите интернет и повторите локальный запрос.

Лицензии и источники. У Qwen и gpt-oss в этой подборке — Apache 2.0; у Gemma — собственные условия ↗. LM Studio распространяется по · условиям приложения ↗. Для Open WebUI проверьте · условия брендинга ↗. Ссылки на первоисточники приведены рядом с описаниями.


1.3. Агентские оболочки

Добавьте агентскую оболочку, когда ИИ должен выполнять задачу в несколько шагов: читать файлы, пользоваться программами и проверять результат.

Харнес (harness) — среда работы агента. Он передаёт задачу модели, хранит ход работы, вызывает инструменты и возвращает модели результат каждого действия. Модель выбирает следующий шаг; харнес организует его выполнение в пределах заданных прав.

МодельQwen, Gemma, gpt-ossПредлагает ответы и следующие действия

ДвижокOllama, LM Studio, vLLMЗапускает модель и принимает запросы

ХарнесOpenClaw, Hermes, OpenCode…Управляет шагами и вызовами инструментов

ИнструментыФайлы, браузер, терминал, MCPЧитают данные и выполняют действия

С чего начать

В учебной сборке ниже используем OpenCode для чтения и создания файлов. Если нужен помощник в мессенджере или другая среда работы, отдельно рассмотрите OpenClaw или Hermes. Для сайтов, скриптов и работы с кодом — OpenCode; если уже пользуетесь VS Code, рассмотрите Cline. Для небольших правок через терминал — Aider.

OpenClaw

Помощник в привычных каналах

OpenClaw
OpenClaw — иллюстрация из официального проекта

Агент на вашем компьютере или сервере. Принимает задачи через чат и мессенджеры, использует инструменты, навыки и автоматизации.

Пример задачи. Собрать сводку из разрешённой папки и подготовить черновик ответа.

С локальной моделью. Подключается к локальному Ollama через его родной API. В настройках OpenClaw нужен адрес без /v1.

С чего начать

Установка → первоначальная настройка → выбор модели → подключение одного канала.

Установка ↗ · Исходники ↗ · Подключение модели ↗

Hermes Agent

Помощник с памятью и навыками

Hermes Agent
Hermes Agent — иллюстрация из официального проекта

Агент Nous Research с памятью между сессиями, повторно используемыми навыками, расписанием и подключением мессенджеров. Есть приложение и терминал.

Пример задачи. Запомнить формат сводки и использовать его при следующей подготовке отчёта.

С локальной моделью. Можно подключить LM Studio или собственный сервер Ollama / vLLM через совместимый endpoint. Hermes Agent — программа; модель выбирается отдельно.

С чего начать

Установить → выбрать провайдера командой hermes model → указать модель → открыть рабочую папку.

Установка ↗ · Исходники ↗ · Подключение модели ↗

OpenCode

Агент для проектов и кода

OpenCode
OpenCode — иллюстрация из официального проекта

Читает проект, предлагает изменения, редактирует файлы и запускает команды. Доступен в терминале, приложении и интеграциях с редактором.

Пример задачи. Добавить кнопку в сайт, изменить код и проверить результат.

С локальной моделью. Поддерживает локальный Ollama и совместимые API. Для Ollama в документации OpenCode используется адрес с /v1; выбирайте модель, умеющую вызывать инструменты.

С чего начать

Установить → открыть папку проекта → подключить провайдера → выбрать модель → дать небольшую задачу.

Установка ↗ · Исходники ↗ · Подключение модели ↗

Cline

Агент внутри редактора

Cline
Cline — иллюстрация из официального проекта

Работает в VS Code: исследует файлы, предлагает правки и выполняет действия через инструменты. Удобен, если проект уже открыт в редакторе.

Пример задачи. Найти ошибку, показать правку и запустить проверку после подтверждения.

С локальной моделью. В настройках можно выбрать Ollama или LM Studio, указать локальный сервер и модель.

С чего начать

Установить расширение → открыть настройки провайдера → выбрать локальную модель → поставить задачу.

Установка ↗ · Исходники ↗ · Подключение модели ↗

Aider

Редактирование кода через терминал

Aider
Aider — иллюстрация из официального проекта

Помощник для работы с файлами проекта и Git. Подходит для небольших, чётко сформулированных изменений и совместного написания кода.

Пример задачи. Исправить функцию в выбранных файлах и проверить изменения в Git.

С локальной моделью. Может работать с моделями Ollama. Качество редактирования зависит от модели и доступного ей контекста.

С чего начать

Установить → перейти в папку проекта → выбрать модель → добавить нужные файлы в диалог.

Установка ↗ · Исходники ↗ · Подключение модели ↗

Как соединить с вашим стеком

В учебном маршруте начните с OpenCode через совместимый API: подробности в необязательном шаге 8 сборки. Для OpenClaw и остальных агентов используйте инструкцию конкретного провайдера; наличие поддержки Ollama не означает одинаковую настройку llama.cpp.

Основной стек: выбранный харнес → API llama-server → Qwen3.8-27B

Базовый чат llama-server остаётся доступен. Open WebUI нужен только для дополнительного интерфейса и поиска по документам. Харнес подключается к серверу модели отдельно и получает свои инструменты. Работающий чат ещё не доказывает, что модель надёжно выполняет многошаговые задания и вызовы инструментов.

1Подключите модель

Выберите локальный или внутренний сервер в настройках провайдера. Название модели должно совпадать с установленным. Адрес и формат API берите из инструкции конкретного харнеса.

2Дайте одну задачу

Создайте пробную папку с копиями двух-трёх документов. Попросите составить обзор и сохранить его в новый файл. Проверьте результат и список действий перед подключением остальных папок.

3Проверьте итог

Откройте созданный файл, сравните с исходниками и посмотрите выполненные действия. Для отправки сообщений, удаления и изменений во внешних системах настройте подтверждение.

Что учитывать в бюджете и настройке. Открытый код оболочки не включает стоимость облачных моделей и внешних инструментов. При локальной модели остаются расходы на оборудование и обслуживание. Для полностью внутреннего сценария проверьте также вспомогательные модели, поиск, мессенджеры и интеграции: Telegram или внешний веб-поиск обращаются во внешние сервисы. Поддержку вашей модели и нужных инструментов проверяйте в небольшом пилоте.

Официальные источники указаны рядом с описаниями. Проверено 11 октября 2026 года.


1.4. Бюджет

Для первого личного запуска я бы выбрал Mac mini M4 Pro с 48 ГБ и Q8 GGUF, если мобильность не нужна. Вариант с 64 ГБ даст запас для длинного контекста и многозадачности; его цену рассчитывают отдельно. Для поездок — MacBook Pro. ПК с модифицированной RTX 4090 имеет смысл при конкретной потребности в NVIDIA/CUDA и работе через FP8 + vLLM. Ниже — цены на страницах продавцов и отдельно расчётные резервы. Наличие не подтверждено заказом; доставка и условия оплаты согласуются с магазином.

СТАЦИОНАРНОЕ РАБОЧЕЕ МЕСТО

Mac mini M4 Pro

Mac mini поколения M4

48 ГБ объединённой памяти · SSD 512 ГБ

≈ 260–350 тыс. ₽

Полный старт: компьютер, периферия и резерв на настройку

  • Компьютер: ориентир 220–300 тыс. ₽.
  • Монитор, клавиатура и мышь: резерв 25–40 тыс. ₽.
  • Настройка: резерв 10–20 тыс. ₽; самостоятельно — 0 ₽ за услуги.

Apple Pro Store ↗ · 219 990 ₽ · нет в наличии · i-Lite ↗ · 259 990 ₽ по поисковому индексу. Страница i-Lite не подтвердилась при повторном открытии; цену и наличие нужно уточнить. Проверяйте точную конфигурацию и наличие у продавца.

ДЛЯ ПОЕЗДОК И РАБОТЫ ВЕЗДЕ

MacBook Pro M5 Pro

MacBook Pro 14 M5 Pro из карточки AppMiStore

48 ГБ памяти · разные диагонали и SSD

≈ 330–530 тыс. ₽

Полный старт; диапазон включает разные конфигурации

  • 16″ / 1 ТБ: 311 490 ₽ по индексу Nistone.
  • 14″ / 2 ТБ: 488 600 ₽ наличными в AppMiStore.
  • Периферия: 0–15 тыс. ₽; настройка: резерв 10–20 тыс. ₽.

Nistone ↗ · 16″ / 1 ТБ · цену уточнить · AppMiStore ↗ · 14″ / 2 ТБ · указано «в наличии». Nistone закрывает прямое чтение страницы кодом 403; цена взята из поискового индекса. Это разные товары, а не разброс цен на один артикул.

СПЕЦИАЛЬНЫЙ ПК ДЛЯ NVIDIA / CUDA

RTX 4090 · 48 ГБ

Модифицированная RTX 4090 48 ГБ из карточки G.Race

Модифицированная карта + системный блок

≈ 585–705 тыс. ₽

Полный старт при оплате GPU наличными

  • Только карта: 438 230 ₽ наличными или 486 922 ₽ безналично.
  • Остальной ПК: расчётный резерв 100–180 тыс. ₽.
  • Периферия: 25–40 тыс. ₽; сборка и настройка: 20–40 тыс. ₽.

G.Race ↗ · поставка из Китая 21–28 дней. При безналичной оплате итог увеличится примерно на 49 тыс. ₽. Цена: G.Race. Нужны условия гарантии именно на модификацию и тест под вашей моделью. Цена системного блока — моя оценка, предложения на сборку пока нет.

Программная часть и дальнейшие расходы

Для стартового стека Mac: локальная модель → llama.cpp ↗ → браузерный интерфейс. Этот состав соответствует шагам 1–6 сборки. На ПК с NVIDIA вместо llama.cpp используйте FP8 и vLLM. Поиск по документам и агент — необязательные шаги 7–8; стоимость их настройки оценивается отдельно. В этой оценке на стартовое ПО заложено 0 ₽; платные приложения и облачные API не включены.

Настройка 10–20 тыс. ₽ для Mac и 20–40 тыс. ₽ для ПК — мой бюджетный резерв, не найденный прайс подрядчика. В него предполагаются установка, тест на небольших текстах, которые вы вставляете в чат, и проверка локальности. Сложные интеграции с корпоративными системами сюда не входят.

Электричество считайте по формуле: мощность в кВт × часы работы × ваш тариф. Пример допущений: при 4 часах в день и 8 ₽/кВт·ч, 60 Вт дают около 58 ₽/месяц, 500 Вт — около 480 ₽/месяц. Это сценарный расчёт, не измерение указанных устройств. Необязательное сопровождение: резерв 0–5 тыс. ₽/месяц.


1.5. Пошаговая сборка

Mac с 48 ГБ → Qwen3.8-27B Q8 GGUF → llama.cpp / llama-server → локальный чат. Шаги 1–6 дают рабочий текстовый чат. Шаги 7–8 — дополнительные возможности. Для MacBook и Mac mini приведены отдельные маршруты сборки; маршрут NVIDIA с FP8 указан после них.

Один шаг — одно действие и проверяемый результат.

Перед командами: как открыть Терминал на Mac

Нажмите ⌘ Пробел, напечатайте Терминал (или Terminal), нажмите Return / Enter. В его окне вставляйте команды из зелёных блоков и нажимайте Return. Кнопка «Копировать» берёт только команду. Текст задания для модели вводится в чат — место ввода всегда подписано.

После обычной команды дождитесь новой строки приглашения (обычно заканчивается % или $). После запуска сервера приглашение не возвращается: окно занято работающей моделью. Для следующих команд откройте Shell → New Tab / Новая вкладка или нажмите ⌘ T. Не вводите команды в окно, где ещё работает сервер.

Маршрут проверяется по частям: установка → файл → чат → агент → файл результата. Если проверка шага не прошла, сначала откройте таблицу ошибок.

Ноутбук

Перед шагом 3 прочитайте как открыть Терминал.

Положите перед собой

Ноутбук + зарядка

Также нужны: интернет для загрузки, 60 ГБ свободного места на SSD. Учебные задания уже даны ниже; затем добавьте свои примеры.

1. Подключите ноутбук
MacBook · до включения. MacBook. Зарядное устройство. Розетка. Положите ноутбук и зарядку перед собой.MacBook · до включенияMacBookMacBookЗарядное устройствоРозетка
Положите ноутбук и зарядку перед собой.
Кадр 1 из 3

Кто делает: Вы.

Полная инструкция и помощь

На входе: Ноутбук из выбранной конфигурации, зарядное устройство и интернет для установки.

Действие: Поставьте MacBook на стол и подключите зарядку. Откройте крышку и включите его.

На выходе: Экран, клавиатура и тачпад уже готовы к работе.

Как именно — подсказка

Эта схема рассчитана на MacBook из памятки с 48 ГБ объединённой памяти. Для ноутбука с Windows сначала нужна отдельная проверка GPU и памяти; эти требования нельзя автоматически переносить на него.

Проверка: Включите ноутбук: виден рабочий стол, индикатор показывает питание от сети.

2. Проверьте свободное место
 → Системные настройки. Основные. Хранилище. Об этом Mac → Память. Сначала проверьте память: 48 ГБ или больше. Затем откройте настройки. → Системные настройкиНастройкиОсновныеХранилищеОб этом MacОсновныеХранилищеОб этом Mac → Память
Сначала проверьте память: 48 ГБ или больше. Затем откройте настройки.
Кадр 1 из 3

Кто делает: Вы.

Полная инструкция и помощь

На входе: Включённый Mac.

Действие:

  1. Нажмите  → Об этом Mac: найдите «Память». Этот маршрут рассчитан на Apple Silicon и 48 ГБ или больше.
  2. Откройте  → Системные настройки → Основные → Хранилище.
  3. Для учебной установки оставьте не менее 60 ГБ свободного места: файл занимает около 28,6 ГБ, остальное — запас на установку и работу. Это ориентир для этого маршрута, а не требование всех моделей.

На выходе: Вы проверили две разные величины: память компьютера и свободное место диска.

Проверка: В «Об этом Mac» — 48 ГБ или больше; в хранилище — свободно не менее 60 ГБ. Если памяти меньше, не переходите к загрузке Q8: выберите меньшую модель с настройщиком.

3. Установите программу запуска
Терминал · открыть через ⌘ Пробел. % brew --version. Если команда не найдена:. сначала установите Homebrew. Найдите «Терминал» через ⌘ Пробел. Скопируйте первую команду под картинкой.Терминал · открыть через ⌘ ПробелTERMINAL · ВВОДИТЕ КОМАНДЫ ЗДЕСЬ% brew --versionЕсли команда не найдена:сначала установите HomebrewReturn ↵ — выполнить команду
Найдите «Терминал» через ⌘ Пробел. Скопируйте первую команду под картинкой.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
brew --version

официальную страницу Homebrew

brew install llama.cpp
llama-server --version

установка llama.cpp

Кто делает: Вы; если нет прав установки — настройщик.

Полная инструкция и помощь

На входе: Mac подготовлен; Терминал открыт по подсказке выше; интернет включён.

Действие:

  1. В Терминале выполните проверку:
brew --version
  1. Если показана версия Homebrew, переходите к следующей команде. Если написано command not found, откройте официальную страницу Homebrew, скопируйте команду под Install Homebrew и выполните её в Терминале. Следуйте подсказкам установки, включая Next steps в конце. При вводе пароля Mac символы не видны — это нормально. Откройте новую вкладку Терминала и повторите brew --version.
  2. Установите программу запуска:
brew install llama.cpp
  1. После окончания проверьте:
llama-server --version

На выходе: В Терминале доступна команда llama-server. Пока модель не скачана и чат не запущен.

Основание: установка llama.cpp. Если Homebrew предложил действия, которых вы не понимаете, передайте текст ошибки настройщику; не продолжайте следующую карточку до успешной проверки.

Проверка: Последняя команда выводит версию / номер сборки, а не command not found. Сохраните этот номер, если потребуется помощь.

▶ Видео к шагу: llama.cpp на Mac

4. Скачайте файл модели
Hugging Face · страница нужного файла. Qwen3.8-27B-Q8_0.gguf. Размер: около 28,6 ГБ. download ↓. Откройте ссылку на точный файл под картинкой. Сверьте имя.Hugging Face · страница нужного файлаСтраница из ссылки в инструкцииQwen3.8-27B-Q8_0.ggufРазмер: около 28,6 ГБdownload ↓
Откройте ссылку на точный файл под картинкой. Сверьте имя.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
mkdir -p "$HOME/Models"

страницу именно файла Qwen3.8-27B-Q8_0.gguf

Кто делает: Вы.

Полная инструкция и помощь

На входе: llama-server установлен; свободно 60 ГБ; есть интернет.

Действие:

  1. В свободной вкладке Терминала создайте папку:
mkdir -p "$HOME/Models"
  1. Откройте страницу именно файла Qwen3.8-27B-Q8_0.gguf и нажмите download. Размер — около 28,6 ГБ. Для этого текстового примера другие файлы (mmproj, mtp, dflash) не нужны.
  2. Дождитесь завершения в списке загрузок браузера. Откройте Finder → Загрузки и найдите Qwen3.8-27B-Q8_0.gguf.
  3. В Finder нажмите ⌘ Shift G, введите ~/Models, нажмите Return. Переместите скачанный файл в эту папку. Не меняйте имя.

На выходе: Файл лежит в Models внутри вашей домашней папки. Это то место, которое использует следующая команда.

Проверка: В Finder выделите файл → ⌘ I («Свойства»): имя точно Qwen3.8-27B-Q8_0.gguf, размер около 28,6 ГБ. Файл с окончанием .download или .crdownload ещё не готов.

▶ Видео к шагу: Запуск модели на Mac

5. Откройте свой чат
Finder · ~/Models. Qwen3.8-27B-Q8_0.gguf. llama-server установлен. Откройте Терминал. Файл уже на месте. Теперь его нужно запустить программой.Finder · ~/ModelsFinder / ФайлыИзбранноеЗагрузкиДомашняя папкаРабочая папкаИМЯ / СОДЕРЖИМОЕQwen3.8-27B-Q8_0.ggufllama-server установленОткройте ТерминалВыбрать файл → пробел: быстрый просмотр
Файл уже на месте. Теперь его нужно запустить программой.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
llama-server -m "$HOME/Models/Qwen3.8-27B-Q8_0.gguf" --alias local-qwen --host 127.0.0.1 --port 8080 --jinja -c 8192

сервер llama.cpp

Кто делает: Вы.

Полная инструкция и помощь

На входе: Готовый файл в ~/Models; llama-server установлен.

Действие:

  1. В Терминале вставьте всю строку и нажмите Return:
llama-server -m "$HOME/Models/Qwen3.8-27B-Q8_0.gguf" --alias local-qwen --host 127.0.0.1 --port 8080 --jinja -c 8192
  1. Дождитесь окончания загрузки модели. Окно будет занято журналом работы — оставьте его открытым.
  2. На этом же Mac откройте браузер. Нажмите ⌘ L, вставьте http://127.0.0.1:8080 и нажмите Return. Это адресная строка браузера, не поле поиска сайта.
  3. В поле сообщения открывшегося чата введите: «Ответь одним словом: готов». Нажмите кнопку отправки рядом с полем.

На выходе: В браузере открыт локальный чат и появился ответ. local-qwen — короткое имя этой модели для подключения агента.

Что означают адреса: http://127.0.0.1:8080 — чат для вас; http://127.0.0.1:8080/v1 — связь для агента. 127.0.0.1 означает этот компьютер. С телефона или другого ноутбука такой адрес ваш Mac не откроет.

Завтра: повторите эту же команду и откройте тот же адрес. Чтобы выключить модель сейчас, в её окне Терминала нажмите Control C. Закрытие вкладки браузера само по себе сервер не выключает. Начальный контекст ограничен 8192 токенами; длинные документы пока не используйте.

Шаблон запуска нужно проверить на установленной версии: сервер llama.cpp.

Проверка: Ответ виден в браузере, а в оставленном Терминале появились строки обработки запроса. Сообщение об ошибке загрузки модели означает, что шаг ещё не выполнен.

▶ Видео к шагу: Как появляется окно чата

6. Проверьте, что всё работает
Локальный чат · новый разговор. Скопируйте учебный текст «Маяк». Дата, время, поручения?. Число участников неизвестно. Возьмите полный текст пробы под картинкой.Локальный чат · новый разговорЧат · поле сообщения и ответСкопируйте учебный текст «Маяк»Дата, время, поручения?Число участников неизвестно↑
Возьмите полный текст пробы под картинкой.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
Встреча «Маяк» назначена на 15 октября в 11:00. Анна готовит смету. Борис бронирует зал. Число участников пока не определено.
Перечисли дату, время, поручения и число участников. Если сведений нет, так и напиши.

Кто делает: Вы.

Полная инструкция и помощь

На входе: Чат ответил; сервер продолжает работать.

Действие:

  1. Вставьте в чат этот учебный текст и задание:
Встреча «Маяк» назначена на 15 октября в 11:00. Анна готовит смету. Борис бронирует зал. Число участников пока не определено.
Перечисли дату, время, поручения и число участников. Если сведений нет, так и напиши.
  1. Сверьте ответ с эталоном ниже.
  2. Отключите Wi-Fi в меню Mac; если подключён сетевой кабель, отключите его тоже. Не останавливайте модель. Начните новый разговор или повторите тот же запрос.
  3. Верните сеть после проверки. Затем проверьте десять коротких примеров из своей работы.

На выходе: Модель отвечает на переданный текст без сети. Вы понимаете, как отличить правильный ответ от выдумки.

Проверка: Должны быть 15 октября, 11:00, Анна — смета, Борис — зал; число участников неизвестно. Формулировки могут отличаться. Сохраните неверные ответы для разбора. Офлайн-проверка относится к этому чату, а не к ещё не установленным внешним инструментам.

Стационарный компьютер · Mac mini

Перед шагом 3 прочитайте как открыть Терминал.

Положите перед собой

Mac mini + монитор + кабель + клавиатура + мышь

Также нужны: интернет для загрузки, 60 ГБ свободного места на SSD. Учебные задания уже даны ниже; затем добавьте свои примеры.

1. Соедините домашний компьютер
Домашнее рабочее место. Mac mini. Монитор + HDMI. Клавиатура + мышь. Разложите компьютер, монитор, кабель и устройства ввода.Домашнее рабочее местоMac miniMac miniМонитор + HDMIКлавиатура + мышь
Разложите компьютер, монитор, кабель и устройства ввода.
Кадр 1 из 3

Кто делает: Вы.

Полная инструкция и помощь

На входе: Mac mini, питание, монитор, кабель, клавиатура и мышь. Маршрут ПК с NVIDIA описан отдельно ниже.

Действие: Подключите монитор к Mac mini, клавиатуру и мышь — по USB или Bluetooth. Затем подключите питание и включите компьютер.

На выходе: Вы видите рабочий стол и можете управлять курсором.

Как именно — подсказка

Основной маршрут — Mac mini из памятки с 48 ГБ. Нужен подходящий кабель HDMI или USB-C к вашему монитору. Если покупаете новый Mac mini и бюджет позволяет, 64 ГБ дадут больше запаса для длинного контекста и других программ. ПК с RTX 4090 48 ГБ собирайте и проверяйте отдельно: перепайка памяти не входит в эту инструкцию.

Проверка: Монитор показывает рабочий стол, клавиатура и мышь управляют компьютером.

2. Проверьте свободное место
 → Системные настройки. Основные. Хранилище. Об этом Mac → Память. Сначала проверьте память: 48 ГБ или больше. Затем откройте настройки. → Системные настройкиНастройкиОсновныеХранилищеОб этом MacОсновныеХранилищеОб этом Mac → Память
Сначала проверьте память: 48 ГБ или больше. Затем откройте настройки.
Кадр 1 из 3

Кто делает: Вы.

Полная инструкция и помощь

На входе: Включённый Mac.

Действие:

  1. Нажмите  → Об этом Mac: найдите «Память». Этот маршрут рассчитан на Apple Silicon и 48 ГБ или больше.
  2. Откройте  → Системные настройки → Основные → Хранилище.
  3. Для учебной установки оставьте не менее 60 ГБ свободного места: файл занимает около 28,6 ГБ, остальное — запас на установку и работу. Это ориентир для этого маршрута, а не требование всех моделей.

На выходе: Вы проверили две разные величины: память компьютера и свободное место диска.

Проверка: В «Об этом Mac» — 48 ГБ или больше; в хранилище — свободно не менее 60 ГБ. Если памяти меньше, не переходите к загрузке Q8: выберите меньшую модель с настройщиком.

3. Установите программу запуска
Терминал · открыть через ⌘ Пробел. % brew --version. Если команда не найдена:. сначала установите Homebrew. Найдите «Терминал» через ⌘ Пробел. Скопируйте первую команду под картинкой.Терминал · открыть через ⌘ ПробелTERMINAL · ВВОДИТЕ КОМАНДЫ ЗДЕСЬ% brew --versionЕсли команда не найдена:сначала установите HomebrewReturn ↵ — выполнить команду
Найдите «Терминал» через ⌘ Пробел. Скопируйте первую команду под картинкой.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
brew --version

официальную страницу Homebrew

brew install llama.cpp
llama-server --version

установка llama.cpp

Кто делает: Вы; если нет прав установки — настройщик.

Полная инструкция и помощь

На входе: Mac подготовлен; Терминал открыт по подсказке выше; интернет включён.

Действие:

  1. В Терминале выполните проверку:
brew --version
  1. Если показана версия Homebrew, переходите к следующей команде. Если написано command not found, откройте официальную страницу Homebrew, скопируйте команду под Install Homebrew и выполните её в Терминале. Следуйте подсказкам установки, включая Next steps в конце. При вводе пароля Mac символы не видны — это нормально. Откройте новую вкладку Терминала и повторите brew --version.
  2. Установите программу запуска:
brew install llama.cpp
  1. После окончания проверьте:
llama-server --version

На выходе: В Терминале доступна команда llama-server. Пока модель не скачана и чат не запущен.

Основание: установка llama.cpp. Если Homebrew предложил действия, которых вы не понимаете, передайте текст ошибки настройщику; не продолжайте следующую карточку до успешной проверки.

Проверка: Последняя команда выводит версию / номер сборки, а не command not found. Сохраните этот номер, если потребуется помощь.

▶ Видео к шагу: llama.cpp на Mac

4. Скачайте файл модели
Hugging Face · страница нужного файла. Qwen3.8-27B-Q8_0.gguf. Размер: около 28,6 ГБ. download ↓. Откройте ссылку на точный файл под картинкой. Сверьте имя.Hugging Face · страница нужного файлаСтраница из ссылки в инструкцииQwen3.8-27B-Q8_0.ggufРазмер: около 28,6 ГБdownload ↓
Откройте ссылку на точный файл под картинкой. Сверьте имя.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
mkdir -p "$HOME/Models"

страницу именно файла Qwen3.8-27B-Q8_0.gguf

Кто делает: Вы.

Полная инструкция и помощь

На входе: llama-server установлен; свободно 60 ГБ; есть интернет.

Действие:

  1. В свободной вкладке Терминала создайте папку:
mkdir -p "$HOME/Models"
  1. Откройте страницу именно файла Qwen3.8-27B-Q8_0.gguf и нажмите download. Размер — около 28,6 ГБ. Для этого текстового примера другие файлы (mmproj, mtp, dflash) не нужны.
  2. Дождитесь завершения в списке загрузок браузера. Откройте Finder → Загрузки и найдите Qwen3.8-27B-Q8_0.gguf.
  3. В Finder нажмите ⌘ Shift G, введите ~/Models, нажмите Return. Переместите скачанный файл в эту папку. Не меняйте имя.

На выходе: Файл лежит в Models внутри вашей домашней папки. Это то место, которое использует следующая команда.

Проверка: В Finder выделите файл → ⌘ I («Свойства»): имя точно Qwen3.8-27B-Q8_0.gguf, размер около 28,6 ГБ. Файл с окончанием .download или .crdownload ещё не готов.

▶ Видео к шагу: Запуск модели на Mac

5. Откройте свой чат
Finder · ~/Models. Qwen3.8-27B-Q8_0.gguf. llama-server установлен. Откройте Терминал. Файл уже на месте. Теперь его нужно запустить программой.Finder · ~/ModelsFinder / ФайлыИзбранноеЗагрузкиДомашняя папкаРабочая папкаИМЯ / СОДЕРЖИМОЕQwen3.8-27B-Q8_0.ggufllama-server установленОткройте ТерминалВыбрать файл → пробел: быстрый просмотр
Файл уже на месте. Теперь его нужно запустить программой.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
llama-server -m "$HOME/Models/Qwen3.8-27B-Q8_0.gguf" --alias local-qwen --host 127.0.0.1 --port 8080 --jinja -c 8192

сервер llama.cpp

Кто делает: Вы.

Полная инструкция и помощь

На входе: Готовый файл в ~/Models; llama-server установлен.

Действие:

  1. В Терминале вставьте всю строку и нажмите Return:
llama-server -m "$HOME/Models/Qwen3.8-27B-Q8_0.gguf" --alias local-qwen --host 127.0.0.1 --port 8080 --jinja -c 8192
  1. Дождитесь окончания загрузки модели. Окно будет занято журналом работы — оставьте его открытым.
  2. На этом же Mac откройте браузер. Нажмите ⌘ L, вставьте http://127.0.0.1:8080 и нажмите Return. Это адресная строка браузера, не поле поиска сайта.
  3. В поле сообщения открывшегося чата введите: «Ответь одним словом: готов». Нажмите кнопку отправки рядом с полем.

На выходе: В браузере открыт локальный чат и появился ответ. local-qwen — короткое имя этой модели для подключения агента.

Что означают адреса: http://127.0.0.1:8080 — чат для вас; http://127.0.0.1:8080/v1 — связь для агента. 127.0.0.1 означает этот компьютер. С телефона или другого ноутбука такой адрес ваш Mac не откроет.

Завтра: повторите эту же команду и откройте тот же адрес. Чтобы выключить модель сейчас, в её окне Терминала нажмите Control C. Закрытие вкладки браузера само по себе сервер не выключает. Начальный контекст ограничен 8192 токенами; длинные документы пока не используйте.

Шаблон запуска нужно проверить на установленной версии: сервер llama.cpp.

Проверка: Ответ виден в браузере, а в оставленном Терминале появились строки обработки запроса. Сообщение об ошибке загрузки модели означает, что шаг ещё не выполнен.

▶ Видео к шагу: Как появляется окно чата

6. Проверьте, что всё работает
Локальный чат · новый разговор. Скопируйте учебный текст «Маяк». Дата, время, поручения?. Число участников неизвестно. Возьмите полный текст пробы под картинкой.Локальный чат · новый разговорЧат · поле сообщения и ответСкопируйте учебный текст «Маяк»Дата, время, поручения?Число участников неизвестно↑
Возьмите полный текст пробы под картинкой.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
Встреча «Маяк» назначена на 15 октября в 11:00. Анна готовит смету. Борис бронирует зал. Число участников пока не определено.
Перечисли дату, время, поручения и число участников. Если сведений нет, так и напиши.

Кто делает: Вы.

Полная инструкция и помощь

На входе: Чат ответил; сервер продолжает работать.

Действие:

  1. Вставьте в чат этот учебный текст и задание:
Встреча «Маяк» назначена на 15 октября в 11:00. Анна готовит смету. Борис бронирует зал. Число участников пока не определено.
Перечисли дату, время, поручения и число участников. Если сведений нет, так и напиши.
  1. Сверьте ответ с эталоном ниже.
  2. Отключите Wi-Fi в меню Mac; если подключён сетевой кабель, отключите его тоже. Не останавливайте модель. Начните новый разговор или повторите тот же запрос.
  3. Верните сеть после проверки. Затем проверьте десять коротких примеров из своей работы.

На выходе: Модель отвечает на переданный текст без сети. Вы понимаете, как отличить правильный ответ от выдумки.

Проверка: Должны быть 15 октября, 11:00, Анна — смета, Борис — зал; число участников неизвестно. Формулировки могут отличаться. Сохраните неверные ответы для разбора. Офлайн-проверка относится к этому чату, а не к ещё не установленным внешним инструментам.

Если у вас ПК с NVIDIA 48 ГБ

Это отдельный маршрут с настройщиком. Открытие /v1 в браузере не создаёт чат. Передайте настройщику такое задание:

Подготовьте на совместимой NVIDIA 48 ГБ Linux, драйвер и vLLM с моделью Qwen/Qwen3.8-27B-FP8. Установите Open WebUI и соедините его с моделью. Передайте мне адрес чата, способ входа, адрес API для агента, точное Model ID, способ запуска после перезагрузки и ваш контакт. Проверьте текстовый запрос и один вызов файлового инструмента из выбранного харнеса.

Что получаете: две разные строки — «открыть чат в браузере» и «вставить API в настройки агента». Адреса заполняет настройщик после установки. Без них переходить к агенту рано.

Что проверяете сами: войдите по адресу чата, вставьте пример про встречу «Маяк» из шага 6 выше, сверьте пять фактов. Для офлайн-проверки ПК с моделью и экраном на одной машине отключите внешнюю сеть после установки. Если модель на другом сервере, оставьте локальную сеть включённой, а доступ в интернет отключает администратор.

Для настройщика: исходный шаблон vLLM
vllm serve Qwen/Qwen3.8-27B-FP8 --host 127.0.0.1 --port 8000

Это шаблон первого текстового запуска, не готовая многопользовательская установка. Подберите длину контекста под видеопамять. API — http://127.0.0.1:8000/v1 только для клиента на том же хосте. Уточните Model ID по /v1/models; у контейнера свой localhost. Для агентов отдельно настройте совместимый шаблон и парсер tool calling vLLM. Версии и параметры запишите в карточку подключения.

Если хотите сравнить MLX на Mac

MLX Community публикует Qwen3.8-27B-8bit ↗ размером около 29,5 ГБ. Это нативный для Apple Silicon вариант, который имеет смысл сравнить с Q8 GGUF на одних и тех же 10 задачах: качество, скорость и расход памяти. Для текста и изображений смотрите инструкцию mlx-vlm в карточке модели. Стандартный CUDA-маршрут vLLM для Mac не подходит; существует отдельный vLLM Metal ↗ на базе MLX. Для первого личного запуска он усложняет настройку без необходимости.

Продолжение: документы и действия

Эти шаги можно пропустить, если достаточно чата. Они не включены автоматически в базовую стоимость настройки.

7. Подключите документы · по желанию
Ваш небольшой текстовый документ. Откройте текст. Выделите нужный фрагмент. Копировать · ⌘ C. Для первого документа достаточно скопировать короткий текст.Ваш небольшой текстовый документFinder / ФайлыИзбранноеЗагрузкиДомашняя папкаРабочая папкаИМЯ / СОДЕРЖИМОЕОткройте текстВыделите нужный фрагментКопировать · ⌘ CВыбрать файл → пробел: быстрый просмотр
Для первого документа достаточно скопировать короткий текст.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

Установка

база знаний

Кто делает: Вы.

Полная инструкция и помощь

На входе: Работающий чат. Маленький текст, который вы можете открыть и прочитать сами.

Действие:

  1. Для первого документа откройте его в редакторе, скопируйте текст и вставьте в чат. Добавьте вопрос: «Кто отвечает за зал? Приведи точную цитату из текста».
  2. Проверьте цитату по исходнику. Это уже работа с документом; устанавливать ещё одну программу для неё не требуется.
  3. Если документов много и нужен поиск по коллекции, передайте настройщику: «Установите Open WebUI, подключите мой сервер модели, настройте локальный поиск. Передайте адрес чата, вход, название коллекции и покажите загрузку одного файла». Установка · база знаний.

На выходе: На вопрос по переданному тексту есть ответ с проверяемой цитатой. Поиск по коллекции появляется только после отдельной настройки.

Проверка: В примере шага 6 ответ — Борис; цитата — «Борис бронирует зал». Если используете коллекцию, откройте источник ответа и найдите эту строку. Пустая ссылка или выдуманная цитата — проверка не пройдена.

8. Подключите агента · по желанию
Уже есть: локальный чат. Вы. Чат. Qwen. Чат уже отвечает. Доступ к папке появится на следующих шагах.Уже есть: локальный чатВы↓Чат↓Qwen
Чат уже отвечает. Доступ к папке появится на следующих шагах.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

Открыть подробную сборку: модель → харнес → инструменты → результат

документация сервера ↗

Кто делает: Вы; настройщик помогает при ошибках.

Полная инструкция и помощь

Открыть подробную сборку: модель → харнес → инструменты → результат

На входе: Чат из шага 6 работает. Пробную папку вы скачаете в А2.

Действие: Пройдите учебный маршрут OpenCode в А1–А3 и А4 ниже. Скачайте готовую папку, подключите уже работающую модель и получите файл summary.md. Для первого раза выбирать оболочку из каталога не требуется.

На выходе: Новый файл создан, его содержание проверено; известны модель, выполненные действия и разрешённая рабочая папка.

Как соединить компоненты

Для Hermes / OpenCode настройщик выбирает совместимый API: на Mac — http://127.0.0.1:8080/v1 и имя модели local-qwen из шага 5; на NVIDIA — адрес и имя модели vLLM. Для вызова инструментов в llama-server обычно нужен --jinja и совместимый шаблон модели; документация сервера ↗. Сначала проверьте один вызов инструмента. Если не работает, проверьте совместимость связки. Альтернативный маршрут через Ollama / LM Studio описан в карточке харнеса. Для отправки сообщений и удаления оставьте подтверждение.


Проверка: Пройдите А1–А4 ниже: проверьте созданный файл и историю вызовов инструментов.

1.6. Подключите харнес и инструменты

Что появится: отдельная программа-агент, подключение к вашей модели и инструменты для работы с данными. На этом сайте вы читаете инструкцию; установка выполняется на выбранном компьютере.

Три подключения: API модели — адрес, куда харнес отправляет запрос; инструмент — программа, выполняющая действие; MCP — способ подключить к харнесу дополнительные инструменты. Ключ доступа подтверждает право обращения к сервису.

Учебный маршрут ниже: Mac + llama-server + OpenCode. Он использует уже запущенную модель и готовые файлы настройки. OpenCode выбран для одного повторяемого примера; Hermes и OpenClaw остаются альтернативами в каталоге. Не устанавливайте три оболочки одновременно. На NVIDIA или в компании настройщик заменяет адрес и имя модели в конфигурации.

Сначала пройдите А1 → А2 → А3 → А4: агент прочитает два файла и создаст третий. А5 (браузер) и А6 (навык) добавляются по желанию после успешного результата.

Что появляется Где находится Как узнать, что готово
Сервер модели Mac или ПК с GPU Отвечает на запрос через API
Харнес Компьютер, на котором выполняется работа Открывается окно или терминальный диалог агента
Рабочая папка В среде, где запущен агент Инструмент читает тестовый файл
MCP-адаптер Рядом с харнесом либо на доступном сервере В харнесе появился список его инструментов
Результат В указанной папке или системе Вы открываете и проверяете его отдельно от чата

А1. Установите одну оболочку

Новая вкладка · ⌘ T. Вкладка 1: llama-server работает. Вкладка 2: свободная строка %. Команды вводите во вкладке 2. Откройте отдельную вкладку Терминала. Не останавливайте модель.Новая вкладка · ⌘ TTERMINAL · ВВОДИТЕ КОМАНДЫ ЗДЕСЬВкладка 1: llama-server работаетВкладка 2: свободная строка %Команды вводите во вкладке 2Return ↵ — выполнить команду
Откройте отдельную вкладку Терминала. Не останавливайте модель.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
brew install anomalyco/tap/opencode
opencode --version

документации OpenCode CLI

Кто делает: Вы.

Полная инструкция и помощь

На входе: Mac из шагов 1–6, Homebrew работает. Сервер модели остаётся в своей вкладке Терминала.

Действие:

  1. Откройте новую вкладку Терминала (⌘ T). В ней выполните:
brew install anomalyco/tap/opencode
  1. Дождитесь завершения и проверьте:
opencode --version
  1. Пока не запускайте диалог: сначала подготовьте папку и настройку в А2.

На выходе: Установлена программа OpenCode для запуска из Терминала. Модель повторно скачивать не нужно.

Маршрут соответствует документации OpenCode CLI. Если OpenCode уже установлен, сначала посмотрите его версию: не заменяйте другую установленную редакцию вслепую. Для существующей установки настройщик проверяет совместимость конфигурации ниже.

Проверка: Показан номер версии. command not found означает, что оболочка ещё не готова.

▶ Видео к шагу: Пример OpenCode на русском

А2. Подключите модель к оболочке

Скачайте и распакуйте AI-pilot.zip. brief.txt. tasks.txt. opencode.json. В архиве — два текста и настройка. Перенесите папку AI-pilot в домашнюю папку.Скачайте и распакуйте AI-pilot.zipFinder / ФайлыИзбранноеЗагрузкиДомашняя папкаРабочая папкаИМЯ / СОДЕРЖИМОЕbrief.txttasks.txtopencode.jsonВыбрать файл → пробел: быстрый просмотр
В архиве — два текста и настройка. Перенесите папку AI-pilot в домашнюю папку.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

Скачайте учебную папку AI-pilot.zip

cd "$HOME/AI-pilot"
opencode

Где OpenCode читает конфигурацию

провайдеры

установка Hermes

инструкции провайдеров Hermes

Кто делает: Вы.

Полная инструкция и помощь

На входе: llama-server работает на этом же Mac; OpenCode установлен.

Действие:

  1. Скачайте учебную папку AI-pilot.zip. В Finder → Загрузки дважды нажмите архив, если браузер ещё не распаковал его.
  2. Внутри папки AI-pilot должны быть brief.txt, tasks.txt и opencode.json. Это наши учебные данные и настройки, не большая модель.
  3. В Finder нажмите ⌘ Shift H (домашняя папка) и перенесите туда AI-pilot. Если папка с таким именем уже есть, не заменяйте её: попросите настройщика выбрать новый путь и изменить команды под него.
  4. В свободной вкладке Терминала выполните по очереди:
cd "$HOME/AI-pilot"
opencode
  1. В открывшийся диалог OpenCode, а не в браузер модели, введите: «Ответь одним словом: готов», нажмите Return.

На выходе: OpenCode получает ответы от той же модели. Наш opencode.json уже содержит нужные значения — вручную заполнять поля не нужно.

Поле в учебном файле Значение Откуда взялось
baseURL http://127.0.0.1:8080/v1 Адрес и порт из запуска llama-server
model local/local-qwen Имя провайдера local + --alias local-qwen
Ключ Не задан Наш сервер принимает только локальное подключение без ключа
permission Запрашивать разрешение Перед вызовом инструмента появится запрос
limit Контекст 8192, ответ до 2048 токенов Согласовано с начальным запуском сервера; токены — небольшие части текста

Не путайте: строка cd меняет рабочую папку, opencode запускает агента, а просьбы на русском вводятся уже внутри агента. Чтобы выйти, введите /exit. Чтобы открыть завтра: запустите модель, затем повторите две команды выше в другой вкладке.

Где OpenCode читает конфигурацию · провайдеры.

Что внутри opencode.json и как подключить другой сервер
{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "local": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Мой сервер модели",
      "options": {"baseURL": "http://127.0.0.1:8080/v1"},
      "models": {"local-qwen": {"name": "Мой Qwen", "limit": {"context": 8192, "output": 2048}}}
    }
  },
  "model": "local/local-qwen",
  "permission": {"*": "ask"}
}

Для другого сервера настройщик выдаёт готовый файл с фактическим адресом и Model ID из /v1/models. Ключ передаётся отдельно через защищённое хранилище или переменную окружения. Файл из архива подходит только для нашего Mac-маршрута. При изменении файла выйдите из OpenCode и откройте его заново из той же папки.

Если выбрали Hermes вместо OpenCode

Это альтернативный маршрут с настройщиком: установка Hermes. После установки CLI откройте свободную вкладку Терминала, выполните hermes model, выберите Custom endpoint, затем OpenAI-compatible Chat Completions. Для нашего Mac укажите http://127.0.0.1:8080/v1, Model ID local-qwen; ключ не нужен, пока сервер не требует авторизации. Запуск выполняется командой hermes из выбранной рабочей папки. Файл opencode.json Hermes не читает. Проверьте ответ и один вызов чтения файла; остальные шаги настройки смотрите в инструкции провайдеров Hermes.

Проверка: В OpenCode выбран «Мой Qwen» / local-qwen; пришёл ответ. В вкладке llama-server виден новый запрос. Если предлагается оплатить облачный сервис, вернитесь к проверке папки и файла настройки.

▶ Видео к шагу: Соединение модели и OpenCode · с 23:17

А3. Дайте доступ к пробной папке

Finder · ~/AI-pilot. brief.txt. tasks.txt. opencode.json. Убедитесь, что оба учебных текста находятся рядом с настройкой.Finder · ~/AI-pilotFinder / ФайлыИзбранноеЗагрузкиДомашняя папкаРабочая папкаИМЯ / СОДЕРЖИМОЕbrief.txttasks.txtopencode.jsonВыбрать файл → пробел: быстрый просмотр
Убедитесь, что оба учебных текста находятся рядом с настройкой.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
Прочитай инструментом файлы brief.txt и tasks.txt из текущей папки. Напиши имена файлов и первую строку каждого. Ничего не изменяй.

Команды интерфейса

Кто делает: Вы.

Полная инструкция и помощь

На входе: OpenCode отвечает из ~/AI-pilot; в папке лежат brief.txt и tasks.txt из архива.

Действие:

  1. Введите в OpenCode:
Прочитай инструментом файлы brief.txt и tasks.txt из текущей папки. Напиши имена файлов и первую строку каждого. Ничего не изменяй.
  1. При запросе разрешения прочитайте имя инструмента и путь. Для чтения этих двух файлов выберите разрешить один раз (Allow once / аналогичный пункт в вашей версии). Не выдавайте доступ к другим папкам.
  2. В Finder откройте AI-pilot, нажмите по каждому текстовому файлу и пробел для быстрого просмотра. Сравните строки.

На выходе: В истории агента виден вызов чтения, а в ответе — реальные строки двух файлов. Чтобы увидеть подробности вызовов в OpenCode, введите /details в его диалоге. Команды интерфейса.

Рабочая папка — место работы, а не техническая защита всего диска. В упражнении используются только вымышленные данные и разовые разрешения. Для реальной изоляции администратор создаёт отдельного пользователя ОС или контейнер.

Проверка: Первая строка brief.txt — Проект: Маяк.; tasks.txt — Поручения по проекту Маяк. Если модель только обещает прочитать, но вызова инструмента нет, переходите к таблице ошибок.

▶ Видео к шагу: Как агент работает с файлами

А4. Дайте задачу с проверяемым выходом

Входные файлы · ~/AI-pilot. brief.txt. tasks.txt. Результата пока нет. У агента есть два исходника. Он должен создать отдельную сводку.Входные файлы · ~/AI-pilotFinder / ФайлыИзбранноеЗагрузкиДомашняя папкаРабочая папкаИМЯ / СОДЕРЖИМОЕbrief.txttasks.txtРезультата пока нетВыбрать файл → пробел: быстрый просмотр
У агента есть два исходника. Он должен создать отдельную сводку.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
Прочитай brief.txt и tasks.txt. Создай в текущей папке summary.md: дата и время встречи, участники, поручения и незакрытые вопросы. У каждого факта укажи имя исходного файла. Не изменяй исходники, ничего не отправляй.

llama.cpp tool calling

Кто делает: Вы.

Полная инструкция и помощь

На входе: Прочитаны brief.txt и tasks.txt; файловые инструменты работают. Браузер для этого шага не требуется.

Действие:

  1. Введите в OpenCode:
Прочитай brief.txt и tasks.txt. Создай в текущей папке summary.md: дата и время встречи, участники, поручения и незакрытые вопросы. У каждого факта укажи имя исходного файла. Не изменяй исходники, ничего не отправляй.
  1. Подтвердите чтение исходников и создание summary.md в AI-pilot. Откажитесь от непонятных действий и разберите их с настройщиком.
  2. В Finder откройте домашнюю папку → AI-pilot → выберите summary.md → нажмите пробел. Если просмотр недоступен, нажмите правой кнопкой → «Открыть в программе» → TextEdit.

На выходе: На диске появился третий содержательный файл — сводка из двух источников. Ответ в чате сам по себе не считается файлом.

Если вместо вызова инструмента модель печатает его название, настройщик проверяет совместимость шаблона и парсера. В нашем запуске уже есть --jinja; это не гарантия поддержки любого инструмента любой сборкой. llama.cpp tool calling.

Проверка: В summary.md должны быть 15 октября, 11:00, 12 участников, Анна — смета до 12 октября, Борис — зал до 13 октября; бюджет ещё не согласован. Сверьте имена источников. В истории видны чтение и запись, исходники не изменились.

▶ Видео к шагу: Задача → созданные файлы

А5. Подключите браузер или внешний сервис

Выйдите из OpenCode: /exit. % brew install node. % node --version. % npx --version. Подготовьте Node.js. Оба номера версий должны выводиться без ошибки.Выйдите из OpenCode: /exitTERMINAL · ВВОДИТЕ КОМАНДЫ ЗДЕСЬ% brew install node% node --version% npx --versionReturn ↵ — выполнить команду
Подготовьте Node.js. Оба номера версий должны выводиться без ошибки.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
brew install node

Скачайте вариант настройки с браузером

Через Playwright открой https://example.com и сообщи заголовок страницы. Если браузер не установлен, предложи его установку и запроси разрешение. Больше никуда не переходи.

Б4

Как OpenCode подключает MCP

официальный Playwright MCP

Кто делает: Вы или настройщик.

Полная инструкция и помощь

На входе: А4 выполнен; хотите дополнительно дать агенту браузер. Интернет включён.

Действие:

  1. В диалоге OpenCode введите /exit. В освободившемся Терминале установите Node.js, который запускает браузерный адаптер:
brew install node
  1. Проверьте две команды по очереди: node --version, затем npx --version. Обе должны вернуть номер версии.
  2. Скачайте вариант настройки с браузером. Он содержит всю конфигурацию, включая модель. В Finder переименуйте его в opencode.json и замените только учебный файл в ~/AI-pilot (свою рабочую конфигурацию не заменяйте). Убедитесь, что не получилось opencode.json.txt.
  3. В этой папке снова запустите opencode. Первый запуск скачает пакет Playwright MCP. Введите в диалог:
Через Playwright открой https://example.com и сообщи заголовок страницы. Если браузер не установлен, предложи его установку и запроси разрешение. Больше никуда не переходи.
  1. Разрешите только установку браузера, если она нужна, и открытие указанной страницы. Если шаг установки не появился, передайте ошибку настройщику.

На выходе: К файловым инструментам добавился браузер. Он открывает внешнюю страницу по команде агента.

Это пример одного внешнего инструмента. Поиск в интернете, календарь, CRM и 1С подключаются каждый отдельно: выберите нужный сервис, его поддерживаемый адаптер и способ входа. Единого ключа «ко всем инструментам» нет. Для компании используйте Б4.

Как OpenCode подключает MCP · официальный Playwright MCP. Учебная настройка скачивает актуальный пакет; для рабочего корпоративного развёртывания администратор закрепляет проверенную версию.

Проверка: В истории есть вызов Playwright, результат — заголовок Example Domain. Самостоятельно откройте https://example.com и сравните. Ответ без вызова браузера не подтверждает подключение.

А6. Добавляйте навыки после проверки инструментов

Скачанные файлы навыка и новой пробы. SKILL.md. brief-2.txt. tasks-2.txt. Скачайте навык и вторую пару исходников по ссылкам под картинкой.Скачанные файлы навыка и новой пробыFinder / ФайлыИзбранноеЗагрузкиДомашняя папкаРабочая папкаИМЯ / СОДЕРЖИМОЕSKILL.mdbrief-2.txttasks-2.txtВыбрать файл → пробел: быстрый просмотр
Скачайте навык и вторую пару исходников по ссылкам под картинкой.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

Скачайте учебный SKILL.md

mkdir -p "$HOME/AI-pilot/.opencode/skills/meeting-summary"

Скачайте вторую пару исходников

Размещение навыков в OpenCode

Кто делает: Вы.

Полная инструкция и помощь

На входе: А4 прошёл проверку. Вы хотите повторять тот же порядок на новых данных.

Действие:

  1. Скачайте учебный SKILL.md. Выйдите из OpenCode через /exit.
  2. В Терминале создайте место для навыка:
mkdir -p "$HOME/AI-pilot/.opencode/skills/meeting-summary"
  1. В Finder нажмите ⌘ Shift G, вставьте ~/AI-pilot/.opencode/skills/meeting-summary. Перенесите туда скачанный SKILL.md с этим точным именем. Точка в .opencode означает скрытую папку; переход по пути её открывает.
  2. Вернитесь в папку AI-pilot и снова запустите OpenCode. Попросите: «Загрузи навык meeting-summary и перечисли его требования». При запросе разрешите чтение навыка.
  3. Скачайте вторую пару исходников, распакуйте её и перенесите brief-2.txt и tasks-2.txt в AI-pilot. Дайте задачу: «Используй meeting-summary для brief-2.txt и tasks-2.txt, сохрани summary-2.md».

На выходе: Агент прочитал сохранённую инструкцию и применил её к новым данным.

Размещение навыков в OpenCode. Навык описывает порядок; установку модели и разрешения на инструменты он не заменяет.

Проверка: В истории виден вызов загрузки навыка. В summary-2.md: проект Север, 22 октября, 14:30, 8 участников, Ирина — программа до 20 октября; место не выбрано. Если повторились данные «Маяка», результат неверен.

Если выбран OpenClaw

Установите OpenClaw, выберите провайдера модели, затем подключите инструменты и выполните пробу А4. Для vLLM используйте отдельную инструкцию провайдера; для Ollama — родной API Ollama, обычно http://127.0.0.1:11434 без /v1. Это два разных маршрута: добавлять Ollama к работающему vLLM автоматически не требуется. Браузер настраивается отдельно. Подключение Telegram — канал общения с агентом; доступ к рабочим файлам оно само по себе не создаёт.


1.7. Видео к инструкции

Начните с русскоязычного примера OpenCode, если хотите увидеть работу агента. Для запуска модели на Mac используйте первый ролик.

Смотрите нужный эпизод, возвращайтесь к карточке шага и выполняйте её проверку. Модель, адреса и команды берите из нашей инструкции; отличия каждого ролика подписаны ниже. Видео открываются на сайте автора в новой вкладке.

Обложка видео: Build llama.cpp From Source (llama-server) on Mac
Английский · Joe Maddalone

llama.cpp на Mac: от установки до своего чата

К инструкции: Сборка · шаги 3–5

Что смотреть. Как выглядит запуск сервера модели на Mac и переход к браузерному интерфейсу.

Как применить у нас. В ролике llama.cpp собирают из исходников. В нашей памятке устанавливаем через Homebrew; файл Q8 и полную команду запуска берите из шагов 3–5.

Смотреть видео ↗
Название у автора

Build llama.cpp From Source (llama-server) on Mac

Обложка видео: OpenCode + Ollama: локальный AI-агент, который пишет код без облака
Русский · 14:17 · Мастерская Кода · Евгений Носенко

Агент работает с файлами: пример OpenCode

К инструкции: Харнес · А1–А4

Что смотреть. Как задача в чате превращается в HTML, CSS и JavaScript в рабочей папке. Смотрите отличие ответа модели от созданных файлов.

Как применить у нас. У автора Ollama и Gemma 3 27B. В учебной сборке используем llama-server, Qwen и папку AI-pilot; подключение и разрешения — по А2–А4.

Смотреть видео ↗ Версия автора на VK Видео ↗Страница автора / источник подборки ↗
Название у автора

OpenCode + Ollama: локальный AI-агент, который пишет код без облака

Обложка видео: IA Local para Programar: Configura Qwen con llama.cpp y OpenCode
Испанский · Nichonauta

Соединение llama.cpp → OpenCode

К инструкции: Харнес · А2, затем А4

Что смотреть. С 23:17 — подключение OpenCode к запущенному llama.cpp; с 26:01 — пример задачи по созданию страницы.

Как применить у нас. Ролик ориентирован на NVIDIA/CUDA, другой вариант Qwen и дополнительные настройки. Для Mac сохраняйте параметры нашей инструкции. Сложные настройки ускорения для первого запуска не нужны.

Смотреть с 23:17 ↗
Название у автора

IA Local para Programar: Configura Qwen con llama.cpp y OpenCode

Подборка проверена 11.10.2026 по описаниям, главам и страницам авторов; названия подтверждены метаданными YouTube. Для перевода используйте субтитры и автоперевод, если они доступны в плеере.

2. Для компании

2.1. Базовый стек

Что понадобится

Сервер или рабочая станция с RTX PRO 6000 Blackwell на 96 ГБ видеопамяти ↗, системной памятью, быстрым SSD и сетью. Одна карта подходит как старт для пилота. Если требуется до 30 одновременных ответов, сравните в пилоте одну и две GPU или два сервера. Число карт определяют измерения и допустимое время ожидания. На личном стенде ведущего RTX 4090 с 48 ГБ обслуживала до 15 одновременных запросов к Qwen3.8-27B (исследование скорости ↗). В обсуждении на занятии прозвучала оценка до 32 параллельных потоков на двух RTX PRO 6000. Для корпоративной конфигурации её нужно проверить отдельно: число потоков само по себе не гарантирует комфортной скорости.

Что входит в «обвязку»

Сервер модели с API, привычный сотрудникам интерфейс, учётные записи и права доступа, подключение внутренних документов и систем, мониторинг нагрузки и резервное копирование. Нужен ответственный за инфраструктуру и доступы, а для рабочих сценариев — владелец со стороны бизнеса. Полезность решения появляется, когда модель встроена в конкретную задачу: например, поиск по документам, переписку с поставщиками или поддержку клиентов.

Сколько закладывать

Рабочий ориентир ведущего: 1,7–2,2 млн ₽ за одну RTX PRO 6000 + около 1 млн ₽ на общую обвязку. Тогда две карты дают 4,4–5,4 млн ₽ на запуск при одном общем комплекте обвязки. Это предварительный бюджет: состав оборудования, работы, налоги и гарантию уточняют в КП.

Как проверить до закупки

Возьмите 10–20 настоящих задач команды, измерьте качество ответов и время ожидания. Затем проверьте нагрузку при 30 одновременных запросах: время до начала ответа, скорость выдачи и очередь. Число сотрудников с доступом и число одновременно работающих людей — разные показатели. Для такой проверки подходит, например, нагрузочный тест vLLM ↗.

Маршрут внедрения:

личный пробный запуск → пилот для небольшой группы → тест на реальных документах и параллельных запросах → окончательная конфигурация компании.

Основной маршрут этой памятки

Сервер с GPU → Qwen3.8-27B-FP8 → vLLM → Open WebUI → поиск по документам и персональные права

Корпоративная инструкция использует официальные FP8-веса и vLLM. На RTX PRO 6000 с 96 ГБ поместится и BF16, но FP8 оставляет больше памяти под контекст и одновременные запросы. Одна GPU — конфигурация пилота с очередью. Две GPU — вариант для сравнения под нагрузкой.

Для первого запуска: переходите к сборке, затем к агенту. Каталоги выше нужны, если вы хотите сравнить альтернативы.


2.2. Модели и программы

Для команды из 20–30 человек разделите интерфейс и сервер моделей. Сначала проверьте одну модель на своих задачах и измерьте параллельную нагрузку.

Модель — это файл с обученными весами. Обвязка — программа, которая его запускает и даёт окно для работы. Открытые веса можно скачать, но правила использования зависят от лицензии. Наличие файла модели само по себе не даёт чат, поиск по документам или права доступа.

1. Выберите модель

Четыре понятных кандидата для старта. Это подборка для сравнения на ваших задачах, а не рейтинг всех существующих моделей. B означает миллиарды параметров, а не гигабайты памяти.

Основная модель памятки

Qwen3.8 · 27B
Иллюстрация Qwen3.8 · 27B от разработчика или из каталога Ollama

Текст, код, изображения и многошаговые задачи. Подходит как кандидат для домашней станции и корпоративного пилота.

Для корпоративного сервера выбран FP8. Число GPU подбирайте по одновременной нагрузке и времени ожидания.

Лицензия весов: Apache 2.0

Исходная модель ↗ · Официальные FP8-веса ↗

Какую команду выбрать: vllm serve Qwen/Qwen3.8-27B-FP8

Репозиторий FP8 выпущен разработчиком модели и содержит пример запуска через vLLM. Зафиксируйте версии модели и движка в пилоте.

Лёгкий старт

Qwen3.5 · 9B
Иллюстрация Qwen3.5 · 9B от разработчика или из каталога Ollama

Текст, код и изображения. Кандидат для первых опытов на ноутбуке; проверьте на своих письмах, таблицах и сканах.

Планируйте 16–24 ГБ памяти устройства для пробного запуска с коротким контекстом. Это ориентир, а не минимальное требование.

Лицензия весов: Apache 2.0

Карточка разработчика и файлы ↗ · Взять в Ollama ↗

Какой файл или команду выбрать: ollama run qwen3.5:9b

Команда выполняется в терминале после установки Ollama. Первая загрузка требует интернета; затем модель можно запускать локально.

Текст + картинки

Gemma 3 · 12B IT
Иллюстрация Gemma 3 · 12B IT от разработчика или из каталога Ollama

Модель Google для диалога, кратких изложений и разбора изображений. Вариант для сравнения качества с Qwen на одной подборке задач.

Для старта в Q4 планируйте 16–24 ГБ памяти. Длинные документы и изображения увеличивают расход.

Лицензия весов: Gemma Terms

Карточка разработчика и файлы ↗ · Взять в Ollama ↗

Какой файл или команду выбрать: ollama run gemma3:12b

Команда выполняется в терминале после установки Ollama. Первая загрузка требует интернета; затем модель можно запускать локально.

Рассуждения и код

gpt-oss · 20B
Иллюстрация gpt-oss · 20B от разработчика или из каталога Ollama

Текстовая модель OpenAI для рассуждений, программирования и работы с инструментами. Изображения напрямую не принимает.

Разработчик указывает запуск в 16 ГБ памяти с MXFP4. Для компьютера с ОС и другими приложениями нужен запас.

Лицензия весов: Apache 2.0

Карточка разработчика и файлы ↗ · Взять в Ollama ↗

Какой файл или команду выбрать: ollama run gpt-oss:20b

Команда выполняется в терминале после установки Ollama. Первая загрузка требует интернета; затем модель можно запускать локально.

Как понимать память. FP8 снижает точность весов до 8 бит; модель в памяти занимает больше места, чем Q4, но оставляет на 96 ГБ GPU запас под контекст и несколько запросов. Размер скачанного файла меньше общего расхода памяти: дополнительно нужны контекст, изображения и программа. Для 20–30 пользователей число одновременно работающих сессий важнее числа учётных записей; окончательную конфигурацию определяет пилот.

2. Выберите обвязку

Основной маршрут инструкции: Open WebUI + vLLM + Qwen3.8-27B-FP8. Ollama — альтернативный движок для пилота; при его выборе меняются настройки подключения и способ нагрузочного теста. Одновременно оба движка не требуются.

Общий чат и документы

Open WebUI
Open WebUI — изображение из официального источника

Веб-интерфейс для сотрудников: чаты, учётные записи, документы и поиск по ним. Подключается к Ollama или совместимому API сервера моделей.

Администратор устанавливает Open WebUI → подключает модель → создаёт пользователей → проверяет права на документы.

Своя лицензия с условиями по брендингу: см. ссылку ниже.

Установка / Docker ↗ · Исходники и релизы ↗

Сервер для команды

vLLM
vLLM — изображение из официального источника

Обслуживает запросы к модели на GPU и предоставляет API. Кандидат для корпоративной нагрузки; отдельный пользовательский чат подключается сверху.

Администратор выбирает совместимую версию → ставит сервер → загружает модель → подключает Open WebUI → измеряет нагрузку.

Открытый код, Apache 2.0.

Установка vLLM ↗ · Исходники ↗

Запуск моделей и API

Ollama
Ollama — изображение из официального источника

Загружает модели из каталога и запускает их локально. К нему можно подключить общий веб-чат. Есть приложение и команды для терминала.

Установить → выбрать локальную модель → выполнить команду из карточки выше. Модели с суффиксом :cloud работают в облаке.

Исходный код Ollama — MIT; у каждой модели своя лицензия.

Скачать Ollama ↗ · Каталог моделей ↗

3. Скачайте и проверьте

1Источник

Откройте карточку разработчика. В Hugging Face файлы находятся на вкладке Files and versions; в Ollama используйте точное имя и размер модели.

2Совместимый формат

Для llama.cpp — GGUF. Для LM Studio — поддерживаемая сборка из поиска приложения. Для vLLM — веса и рецепт запуска из карточки модели; GGUF не универсален.

3Пробный результат

Задайте одинаковые вопросы двум моделям. Проверьте русский язык, ответы по документу и скорость. Затем отключите интернет и повторите локальный запрос.

Лицензии и источники. У Qwen и gpt-oss в этой подборке — Apache 2.0; у Gemma — собственные условия ↗. LM Studio распространяется по · условиям приложения ↗. Для Open WebUI проверьте · условия брендинга ↗. Ссылки на первоисточники приведены рядом с описаниями.

Для поиска по документам нужен отдельный компонент. Qwen3.8 пишет ответ, а embedding-модель помогает находить нужные фрагменты. Кандидат для внутреннего поиска — Qwen3-Embedding-0.6B ↗ (Apache 2.0). Настройщик запускает её внутри контура через совместимый сервис, подключает к Open WebUI и проверяет поиск на русском языке. Также нужны извлечение текста и индекс; для сканов — OCR. · Как устроен поиск в Open WebUI ↗.


2.3. Агентские оболочки

Общий сервер моделей можно использовать для разных агентов сотрудников. Рабочие папки, память и права каждого агента настраиваются отдельно.

Харнес (harness) — среда работы агента. Он передаёт задачу модели, хранит ход работы, вызывает инструменты и возвращает модели результат каждого действия. Модель выбирает следующий шаг; харнес организует его выполнение в пределах заданных прав.

МодельQwen, Gemma, gpt-ossПредлагает ответы и следующие действия

ДвижокOllama, LM Studio, vLLMЗапускает модель и принимает запросы

ХарнесOpenClaw, Hermes, OpenCode…Управляет шагами и вызовами инструментов

ИнструментыФайлы, браузер, терминал, MCPЧитают данные и выполняют действия

С чего начать

Для сотрудников с офисными задачами начните пилот с OpenClaw или Hermes. Для разработки выберите OpenCode, Cline или Aider. Выбор по задаче — рекомендация этой памятки; устанавливать всё сразу не требуется.

OpenClaw

Помощник в привычных каналах

OpenClaw
OpenClaw — иллюстрация из официального проекта

Агент на вашем компьютере или сервере. Принимает задачи через чат и мессенджеры, использует инструменты, навыки и автоматизации.

Пример задачи. Собрать сводку из разрешённой папки и подготовить черновик ответа.

С локальной моделью. Подключается к локальному Ollama через его родной API. В настройках OpenClaw нужен адрес без /v1.

С чего начать

Установка → первоначальная настройка → выбор модели → подключение одного канала.

Установка ↗ · Исходники ↗ · Подключение модели ↗

Hermes Agent

Помощник с памятью и навыками

Hermes Agent
Hermes Agent — иллюстрация из официального проекта

Агент Nous Research с памятью между сессиями, повторно используемыми навыками, расписанием и подключением мессенджеров. Есть приложение и терминал.

Пример задачи. Запомнить формат сводки и использовать его при следующей подготовке отчёта.

С локальной моделью. Можно подключить LM Studio или собственный сервер Ollama / vLLM через совместимый endpoint. Hermes Agent — программа; модель выбирается отдельно.

С чего начать

Установить → выбрать провайдера командой hermes model → указать модель → открыть рабочую папку.

Установка ↗ · Исходники ↗ · Подключение модели ↗

OpenCode

Агент для проектов и кода

OpenCode
OpenCode — иллюстрация из официального проекта

Читает проект, предлагает изменения, редактирует файлы и запускает команды. Доступен в терминале, приложении и интеграциях с редактором.

Пример задачи. Добавить кнопку в сайт, изменить код и проверить результат.

С локальной моделью. Поддерживает локальный Ollama и совместимые API. Для Ollama в документации OpenCode используется адрес с /v1; выбирайте модель, умеющую вызывать инструменты.

С чего начать

Установить → открыть папку проекта → подключить провайдера → выбрать модель → дать небольшую задачу.

Установка ↗ · Исходники ↗ · Подключение модели ↗

Cline

Агент внутри редактора

Cline
Cline — иллюстрация из официального проекта

Работает в VS Code: исследует файлы, предлагает правки и выполняет действия через инструменты. Удобен, если проект уже открыт в редакторе.

Пример задачи. Найти ошибку, показать правку и запустить проверку после подтверждения.

С локальной моделью. В настройках можно выбрать Ollama или LM Studio, указать локальный сервер и модель.

С чего начать

Установить расширение → открыть настройки провайдера → выбрать локальную модель → поставить задачу.

Установка ↗ · Исходники ↗ · Подключение модели ↗

Aider

Редактирование кода через терминал

Aider
Aider — иллюстрация из официального проекта

Помощник для работы с файлами проекта и Git. Подходит для небольших, чётко сформулированных изменений и совместного написания кода.

Пример задачи. Исправить функцию в выбранных файлах и проверить изменения в Git.

С локальной моделью. Может работать с моделями Ollama. Качество редактирования зависит от модели и доступного ей контекста.

С чего начать

Установить → перейти в папку проекта → выбрать модель → добавить нужные файлы в диалог.

Установка ↗ · Исходники ↗ · Подключение модели ↗

Как соединить с вашим стеком

Агент сотрудника → внутренний API → vLLM + модель на сервере компании

Обычный чат Open WebUI можно сохранить для вопросов и документов. Харнес подключается к серверу модели отдельно и получает свои инструменты. Работающий чат ещё не доказывает, что модель надёжно выполняет многошаговые задания и вызовы инструментов.

1Подключите модель

Выберите локальный или внутренний сервер в настройках провайдера. Название модели должно совпадать с установленным. Адрес и формат API берите из инструкции конкретного харнеса.

2Дайте одну задачу

Создайте отдельную рабочую область для пилотной группы, подключите внутренний сервер моделей и задайте доступ к нужным источникам. Общий сервер модели не означает общую память агентов. Проверьте разделение данных двумя тестовыми пользователями.

3Проверьте итог

Откройте созданный файл, сравните с исходниками и посмотрите выполненные действия. Для отправки сообщений, удаления и изменений во внешних системах настройте подтверждение.

Что учитывать в бюджете и настройке. Открытый код оболочки не включает стоимость облачных моделей и внешних инструментов. При локальной модели остаются расходы на оборудование и обслуживание. Для полностью внутреннего сценария проверьте также вспомогательные модели, поиск, мессенджеры и интеграции: Telegram или внешний веб-поиск обращаются во внешние сервисы. Поддержку вашей модели и нужных инструментов проверяйте в небольшом пилоте.

Официальные источники указаны рядом с описаниями. Проверено 11 октября 2026 года.


2.4. Бюджет и поставщики

Начните с измерения нагрузки. 30 учётных записей не означают 30 одновременных генераций. Один GPU — кандидат для пилота с очередью; два GPU — кандидат для более высокой нагрузки. Ни один из вариантов не имеет подтверждённой в этой оценке производительности на 30 параллельных запросах. Рабочие ноутбуки сотрудников считаем уже имеющимися.

Одна RTX PRO 6000 · пилот

RTX PRO 6000 Blackwell 96 ГБ из карточки MDM

2,7–3,2 млн ₽ на запуск = одна карта за 1,7–2,2 млн ₽ + 1 млн ₽ общей обвязки.

Две RTX PRO 6000 · проверка нагрузки 30 человек

Изображение сервера с двумя RTX PRO 6000 из карточки Сервис 2010

4,4–5,4 млн ₽ на запуск = две карты по 1,7–2,2 млн ₽ + тот же 1 млн ₽ общей обвязки. Расчёт предполагает одну совместимую платформу, а не отдельный сервер под каждую карту. Два GPU в одном сервере не дают отказоустойчивость самого сервера.

Где запросить оборудование

MDM Electronics — RTX PRO 6000 · Сервис 2010 / Abgreyd — сервер с двумя GPU · ITELON — Server Edition · ServerMall.

Фото карты — из карточки MDM, сервера — из карточки Сервис 2010. Ссылки сохранены для запроса спецификации; бюджет выше — ориентир ведущего, а не текущий прайс этих магазинов. Наличие, версия карты, гарантия и налоги требуют подтверждения поставщика.

Что входит в «обвязку»

В запросе КП перечислите серверное шасси, CPU, RAM, NVMe, питание и охлаждение, сеть, ИБП, резервное копирование, установку vLLM и интерфейса, права доступа, мониторинг и нагрузочный тест. Миллион рублей — бюджетный ориентир ведущего, а не подтверждённая цена этого полного перечня. Поставщик должен показать состав и стоимость каждой позиции. Отдельно уточните версию GPU (Server или Workstation Edition), налоги, гарантию, доставку и совместимость двух карт в одном шасси. Интеграции с 1С/CRM, OCR сложных сканов, лицензии и круглосуточный SLA оцениваются отдельно.

Эксплуатация и стоимость первого года

Техническое сопровождение: резерв 30–80 тыс. ₽/месяц. Это 360–960 тыс. ₽/год на обновления, мониторинг, резервные копии и устранение сбоев. Внутренний администратор может выполнять эту работу, но его время тоже имеет стоимость. Развитие бизнес-сценариев и 24/7 SLA оцениваются отдельно.

Пример электричества: при средней нагрузке 0,8–1,5 кВт, круглосуточной работе и условном тарифе 8 ₽/кВт·ч получаем 4 608–8 640 ₽ за 30 дней. Это допущения, не измерение сервера. Охлаждение и размещение в ЦОД сюда не входят.

Для двух GPU первый год ≈ 4,82–6,46 млн ₽ = запуск 4,4–5,4 млн ₽ + сопровождение 0,36–0,96 млн ₽ + электричество 0,055–0,104 млн ₽. Налоговые поправки, охлаждение, аренда и работы вне состава «обвязки» увеличат сумму.

Что проверить в пилоте: 10–20 реальных задач → нагрузка 1 / 5 / 10 / 20 / 30 одновременных запросов → время до первого токена, скорость ответа, очередь и качество. Используйте одну и ту же модель, контекст и длину ответа. Пример инструмента — vLLM bench serve ↗. Для модели, помещающейся на одном GPU, можно проверить две реплики с распределением запросов. Объём памяти двух GPU не становится автоматически единой памятью для одного запроса.

Состав корпоративного стека

Qwen3.8-27B-FP8 + vLLM → Open WebUI → персональные учётные записи → локальная embedding-модель, извлечение текста и индекс → мониторинг и резервное копирование. Это состав шагов 1–9 инструкции. Отдельно нужны владелец инфраструктуры и владелец бизнес-сценария. Выбор ПО и проверка лицензий входят в проектирование; платные лицензии в этой оценке не заложены. OCR сложных сканов, интеграции и настройка агентов из шага 10 требуют отдельной оценки.

Для запроса поставщику: точная версия GPU и артикул, CPU/RAM/SSD, охлаждение и питание, цена с налогами и доставкой, гарантия на весь сервер, срок поставки, сборка и тест. Запросите тест вашей модели на 30 параллельных запросах с согласованным временем ожидания. Ориентир 1 млн ₽ на обвязку нужно подтвердить спецификацией и предложением на работы.


2.5. Пилот и внедрение

Сервер с GPU → Qwen3.8-27B-FP8 → vLLM → Open WebUI → поиск по документам и персональные права. Шаги 1–8 выполняются на пилотном стенде, шаг 9 — закупка или принятие окончательной конфигурации и передача команде. Агент добавляется отдельно в шаге 10.

Если вы руководитель или сотрудник: не вводите серверные команды на своём ноутбуке. В карточках ниже вы передаёте конкретное задание администратору, получаете адрес / файл / протокол и сами проверяете результат. Если администратора пока нет, начните с выбора исполнителя; готовый сервер не настраивает себя.

Если вы администратор: используйте официальные инструкции vLLM и Open WebUI для выбранной ОС, сети и способа установки. Эта памятка задаёт последовательность и приёмку; конкретные команды вашей инфраструктуры фиксируются в паспорте системы. Сотрудник должен получить уже заполненные адреса, а не шаблоны.

9 основных шагов и один дополнительный шаг с агентом для 20–30 человек.

Подготовьте комплект

Сервер в сборе + ИБП + место с охлаждением + внутренняя сеть

Также нужны: рабочие компьютеры сотрудников, модель и интерфейс, разрешённые документы, администратор и владелец задачи.

1. Выберите первую задачу

Таблица «Пилот ИИ» · образец. Входной файл | Задание | Эталон. Пока нет примеров. Нужны 10–20 рабочих проб. Откройте привычную таблицу. Добавьте три колонки и критерий времени.Таблица «Пилот ИИ» · образецПРОВЕРОЧНЫЙ ЛИСТ · ОБРАЗЕЦВходной файл | Задание | ЭталонПока нет примеровНужны 10–20 рабочих проб
Откройте привычную таблицу. Добавьте три колонки и критерий времени.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

brief.txt

Кто делает: Руководитель и сотрудники.

Полная инструкция и помощь

На входе: Владелец процесса и два сотрудника, выполняющие похожую работу.

Действие:

  1. Создайте обычную таблицу «Пилот ИИ» в Excel или другом привычном редакторе. Колонки: № / входной файл / задание / правильные факты / допустимое время / результат пробы.
  2. Для первой строки возьмите brief.txt: задание «Когда встреча и сколько участников?»; факты — 15 октября, 11:00, 12 участников. Допустимое время согласуйте с сотрудниками; например, 30 секунд — только пример критерия, не обещание скорости.
  3. Добавьте 10–20 своих разрешённых примеров с ответами, которые сотрудник умеет проверить. Передайте таблицу администратору.

На выходе: Есть таблица с понятным входом и эталоном для каждого задания.

Проверка: Другой сотрудник может проверить ответ по таблице без объяснений автора. Укажите число людей, которые могут запускать задачу одновременно: 30 учётных записей и 30 одновременных запросов — разные нагрузки.

2. Получите пилотный стенд

Заявка исполнителю · образец. Таблица пилота приложена. Модель: Qwen3.8-27B-FP8. Запросить тест оборудования. Передайте поставщику таблицу задач и запрос из подробностей.Заявка исполнителю · образецКАРТОЧКА ДЛЯ ЗАПОЛНЕНИЯ · ОБРАЗЕЦТаблица пилота приложенаМодель: Qwen3.8-27B-FP8Запросить тест оборудования
Передайте поставщику таблицу задач и запрос из подробностей.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

раздела бюджета

Кто делает: Администратор и закупщик; руководитель принимает результат.

Полная инструкция и помощь

На входе: Таблица задач и администратор, отвечающий за установку.

Действие:

  1. Выберите из раздела бюджета поставщика или используйте имеющееся оборудование. Передайте ему таблицу задач и текст запроса ниже.
  2. Получите условия теста: даты, конфигурацию, стоимость, куда разрешено загружать данные, кто устанавливает ПО и кто устраняет ошибки.
  3. Администратор проверяет вход на стенд; вам передаёт заполненную спецификацию и срок готовности чата.

На выходе: Выделен реальный стенд для проб, назначен исполнитель.

Текст запроса поставщику: «Нужен пилот локального ИИ для 20–30 сотрудников. Проверьте Qwen3.8-27B-FP8 через vLLM на приложенных заданиях. Укажите точную конфигурацию и стоимость теста. Предоставьте протокол качества, времени и ошибок при 1, 5, 10, 20 и 30 запросах. Отдельно укажите стоимость оборудования, установки, поддержки, налоги и доставку. Закупку согласуем после проверки».

Секретные рабочие данные на внешний стенд передавайте только по согласованным условиям; учебные файлы памятки вымышленные.

Проверка: В спецификации есть модель и число GPU, видеопамять, RAM, SSD и срок доступа. Ссылка на каталог оборудования без выделенного стенда не считается результатом.

3. Подключите сервер

Стенд и условия размещения. Сервер. ИБП + питание. Сеть + охлаждение. Физическое подключение выполняет инженер по спецификации.Стенд и условия размещенияИБПСерверИБП + питаниеСеть + охлаждение
Физическое подключение выполняет инженер по спецификации.
Кадр 1 из 3

Кто делает: Инженер; сотрудник получает условия подключения.

Полная инструкция и помощь

На входе: Стенд выделен; известны размещение и ответственный инженер.

Действие:

  1. Для своего сервера инженер подключает питание через подходящий ИБП, внутреннюю сеть и охлаждение по спецификации. Для арендованного — проверяет согласованный защищённый доступ.
  2. Попросите передать короткую запись: где стоит сервер / из какой сети доступен / нужен ли VPN / кто включает / кому звонить.
  3. С рабочего места пилотного сотрудника инженер проверяет связь. Если нужен VPN, он устанавливает клиент и показывает вход.

На выходе: Сервер доступен из той сети, где будут работать сотрудники.

Проверка: Инженер демонстрирует подключение с рабочего компьютера сотрудника. Сам по себе включённый индикатор питания не доказывает доступность. Конкретные кабели и электрические подключения выбирает специалист.

4. Проверьте оборудование

Спецификация заказа. GPU и количество. Видеопамять / RAM / SSD. Питание и охлаждение. Откройте согласованную спецификацию.Спецификация заказаПРОВЕРОЧНЫЙ ЛИСТ · ОБРАЗЕЦGPU и количествоВидеопамять / RAM / SSDПитание и охлаждение
Откройте согласованную спецификацию.
Кадр 1 из 3

Кто делает: Инженер; закупщик сверяет акт.

Полная инструкция и помощь

На входе: Сервер подключён; спецификация сохранена.

Действие:

  1. Передайте инженеру спецификацию из шага 2. Попросите аппаратный тест и снимок фактических GPU и памяти.
  2. Инженер проверяет драйвер, ошибки GPU, память, диски, питание и температуру под тестовой нагрузкой. Длительность и метод указывает в протоколе.
  3. Сверьте таблицу «заказано / установлено / проверено». При расхождении верните поставщику на уточнение до запуска пилота.

На выходе: Есть подписанный исполнителем протокол и фактическая конфигурация.

Проверка: Число GPU и объём памяти совпадают со спецификацией; ошибки и перегрев разобраны. Запись «всё нормально» без результатов теста недостаточна.

5. Запустите внутренний чат

Администратор выдаёт три значения. URL страницы чата. Ваш способ входа. Название модели в списке. Получите заполненную карточку. Адрес /v1 предназначен для программ, а не для чата.Администратор выдаёт три значенияКАРТОЧКА ДЛЯ ЗАПОЛНЕНИЯ · ОБРАЗЕЦURL страницы чатаВаш способ входаНазвание модели в списке
Получите заполненную карточку. Адрес /v1 предназначен для программ, а не для чата.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

Установка Open WebUI

vLLM

Официальная инструкция соединения

Кто делает: Администратор устанавливает; сотрудник входит и проверяет.

Полная инструкция и помощь

На входе: Оборудование проверено, назначены администратор и два пилотных пользователя.

Действие:

  1. Передайте администратору: «Разверните Qwen3.8-27B-FP8 через vLLM, установите Open WebUI и подключите его к модели. Создайте два персональных входа. Выдайте мне адрес страницы чата, способ входа и название модели в списке».
  2. Получите заполненные значения. На рабочем компьютере откройте браузер, вставьте адрес чата в адресную строку и войдите своей учётной записью.
  3. Создайте New Chat / Новый чат, в выборе модели укажите имя, выданное администратором. Вставьте текст brief.txt и вопрос: «Когда встреча и сколько участников?». Нажмите отправку.

На выходе: Вы переписываетесь с корпоративной моделью в браузере. Сотруднику не нужен собственный GPU.

Администратору: где соединяются Open WebUI и модель

Установка Open WebUI · vLLM.

В Open WebUI откройте Settings → Admin → Connections, добавьте OpenAI-compatible соединение с действительным адресом API vLLM и ключом, если он настроен. Проверьте список моделей и сохраните. Официальная инструкция соединения. В контейнере 127.0.0.1 указывает на этот контейнер; адрес vLLM должен быть доступен именно из Open WebUI. Первая страница сотрудника — URL Open WebUI, не URL vLLM. Назначьте пользователей и права до выдачи доступа.

Проверка: Ответ: 15 октября, 11:00, 12 участников. Администратор находит этот запрос в журнале vLLM. Если вы видите JSON или ошибку /v1, вам передали адрес API вместо адреса чата.

▶ Видео к шагу: Первый вход в Open WebUI · с 06:00

6. Настройте доступ к документам

Open WebUI · Workspace → Knowledge. Рабочая область / Workspace. Знания / Knowledge. Создать / Create. Откройте Knowledge. Если пункта нет, администратор должен выдать права.Open WebUI · Workspace → KnowledgeСтраница из ссылки в инструкцииРабочая область / WorkspaceЗнания / KnowledgeСоздать / Create
Откройте Knowledge. Если пункта нет, администратор должен выдать права.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

Инструкция Knowledge

Кто делает: Администратор настраивает поиск и права; сотрудники проверяют.

Полная инструкция и помощь

На входе: Чат работает; есть два тестовых пользователя с разными правами.

Действие:

  1. Попросите администратора настроить локальные обработку документов и поиск, выдать право создавать учебную коллекцию. Подготовьте brief.txt и отдельный вымышленный файл для другого отдела, например с фразой «Код учебного отдела Б: СИНИЦА-42».
  2. В Open WebUI откройте Workspace / Рабочая область → Knowledge / Знания → Create / Создать. Назовите коллекцию «Пилот — отдел А», загрузите brief.txt и дождитесь окончания обработки. Если этих пунктов нет, администратор должен выдать права или создать коллекцию сам.
  3. В новом чате напечатайте #, выберите эту коллекцию и спросите: «Сколько участников встречи? Приведи цитату и источник».
  4. Откройте ссылку на источник ответа. Затем с администратором повторите проверку из учётной записи другого отдела, которой эта коллекция не разрешена.

На выходе: Разрешённый документ находится, источник открывается; чужая коллекция не раскрывается.

Инструкция Knowledge. Индекс — подготовленная база для поиска по загруженным текстам; он не возникает от установки модели. Для сканов сначала нужно распознавание. Если поиск не работает, проверяйте извлечение текста, обработку, выбранную коллекцию и режим поиска.

Проверка: В разрешённом ответе — 12 участников и строка brief.txt. Ограниченная учётная запись не видит документ и не получает его текст. Администратор проверяет отказ также на уровне поиска, до передачи фрагмента модели.

▶ Видео к шагу: Обзор интерфейса Open WebUI

7. Проверьте резервную копию

Что нужно сохранить. Настройки и пользователи. Документы и поиск. Отдельное хранилище. Администратор сохраняет данные и настройки пилота.Что нужно сохранитьНастройки и пользователи↓Документы и поиск↓Отдельное хранилище
Администратор сохраняет данные и настройки пилота.
Кадр 1 из 3

Кто делает: Администратор; владелец задачи проверяет восстановленное.

Полная инструкция и помощь

На входе: Есть настроенный чат, коллекция «Пилот — отдел А» и тестовые учётные записи.

Действие:

  1. Попросите администратора сохранить настройки, пользователей, документы и нужные данные поиска на отдельное хранилище, затем восстановить их в отдельную тестовую среду.
  2. Получите адрес восстановленного чата и время, на которое сделана копия. Не заменяйте рабочий сервер ради проверки.
  3. Войдите, откройте учебную коллекцию, задайте вопрос про 12 участников. Повторите проверку запрещённого доступа.

На выходе: Резервная копия доказала пригодность; записаны ответственный, расписание и время восстановления.

Проверка: В восстановленной среде открывается исходный документ и сохраняются права. Наличие файла архива без пробного восстановления не завершает шаг.

8. Проверьте работу под нагрузкой

Таблица пилота и согласованные пределы. Те же задания. Те же исходные документы. Критерии качества и времени. Передайте инженеру прежние задания: сравнивать нужно одинаковые условия.Таблица пилота и согласованные пределыПРОВЕРОЧНЫЙ ЛИСТ · ОБРАЗЕЦТе же заданияТе же исходные документыКритерии качества и времени
Передайте инженеру прежние задания: сравнивать нужно одинаковые условия.
Кадр 1 из 3

Кто делает: Администратор измеряет; сотрудники сверяют качество.

Полная инструкция и помощь

На входе: Работающий пилот и таблица критериев из шага 1.

Действие:

  1. Передайте администратору те же задания из таблицы «Пилот ИИ». Он запускает серии на 1, 5, 10, 20 и 30 одновременных запросов.
  2. Попросите таблицу: параллельные запросы / время до первого текста / время до полного ответа / ошибки / доля правильных ответов / длина входа и ответа. Для каждой серии запишите параметры модели.
  3. Сравните каждую строку с согласованными пределами. Если 30 запросов не проходят, уменьшайте одновременную нагрузку или испытывайте другую конфигурацию.

На выходе: Вы знаете измеренную вместимость именно своего стенда, а не число из рекламы.

Проверка: Протокол содержит реальные значения и примеры ответов; есть явно принятое число одновременных задач. Для агентов замер повторяется в Б6: одна задача агента вызывает модель несколько раз.

9. Передайте систему команде

Паспорт системы · образец. Адрес чата и способ входа. Коллекция и модель. Поддержка и перезапуск. Попросите администратора заполнить паспорт системы реальными значениями.Паспорт системы · образецКАРТОЧКА ДЛЯ ЗАПОЛНЕНИЯ · ОБРАЗЕЦАдрес чата и способ входаКоллекция и модельПоддержка и перезапуск
Попросите администратора заполнить паспорт системы реальными значениями.
Кадр 1 из 3

Кто делает: Владелец задачи и администратор.

Полная инструкция и помощь

На входе: Проверены чат, документы, права, восстановление и нагрузка.

Действие:

  1. По протоколу утвердите конфигурацию и закупку, если она нужна. На окончательном сервере повторите шаги 4–8.
  2. Попросите администратора заполнить паспорт ниже и дать сотруднику короткую инструкцию входа с реальными адресами.
  3. Новый сотрудник, не участвовавший в настройке, выполняет тест шага 5, затем шага 6. После этого подключайте остальных в пределах измеренной нагрузки.

На выходе: У команды есть работающая система, адреса, понятные действия и поддержка.

Паспорт системы — заполнить после установки

Поле Что записать администратору
Чат Полный URL страницы для браузера; название модели в списке
Вход и сеть Как получить личный вход; нужен ли VPN
Модель для агента Base URL, Model ID, способ получения персонального ключа; сам секрет сюда не вписывать
Агент Название и версия, где открыть, рабочая папка
Документы Название доступной коллекции, ответственный за обновление
Инструмент Что подключено, имя инструмента, кто выдаёт доступ
Проверки Где лежит таблица пилота и протокол восстановления
Поддержка Контакт, часы работы, что приложить к обращению
Запуск после перезагрузки Кто проверяет доступность и как её восстановить

Это бланк, а не готовые настройки. Пока поля пустые, сотруднику систему не передают.

Проверка: Новый сотрудник сам входит, находит учебный документ и знает контакт поддержки. Если ему приходится узнавать адреса устно, паспорт ещё не заполнен.

Продолжение: агент выполняет действия

10. Добавьте агента к одному сценарию · по желанию

Корпоративный чат уже работает. Сотрудник. Open WebUI. Qwen через vLLM. Чат — исходная готовность для следующего маршрута.Корпоративный чат уже работаетСотрудник↓Open WebUI↓Qwen через vLLM
Чат — исходная готовность для следующего маршрута.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

Открыть подробную сборку агентов сотрудников

Кто делает: Вы; настройщик помогает при ошибках.

Полная инструкция и помощь

Открыть подробную сборку агентов сотрудников

На входе: Работающий внутренний API модели и согласованный сценарий автоматизации.

Действие: Разверните один выбранный харнес для пилотного пользователя, подключите внутренний API модели и выделенную рабочую область.

На выходе: Агент выполняет согласованную задачу, сохраняет результат и не получает доступ к чужой рабочей области.

Как соединить компоненты

Администратор задаёт внутренний адрес API, модель, индивидуальные права, журнал действий и лимиты. Память агента и доступы к инструментам проверяются отдельно от прав Open WebUI. Повторите нагрузочный тест с агентскими задачами: одна задача может вызывать модель много раз. Настройка харнеса и интеграций оценивается отдельно от базового чата.


Проверка: Пройдите Б1–Б6: проверяются инструменты, результат и разделение пользователей.

2.6. Подключите агентов сотрудников

Это продолжение шага 10: шесть конкретных операций для администратора и владельца задачи. Для пилота выберите один харнес и двух тестовых пользователей. Здесь показан вариант с отдельными рабочими средами агентов внутри компании.

Что создаётся Где Кто отвечает
Общая модель и API Сервер с GPU Администратор инфраструктуры
Шлюз с авторизацией и журналом Перед API модели во внутренней сети Администратор инфраструктуры
Рабочая среда каждого агента Рабочее место или выделенная среда сервера Администратор
Доступ к документам и бизнес-системам В инструментах и самих системах Владелец данных и администратор
Итог работы Согласованная папка или система Владелец задачи

Б1. Создайте рабочую среду агента

Задание администратору. OpenCode для двух пользователей. Две отдельные рабочие папки. Личный способ входа. Администратор устанавливает агент и выдаёт точную инструкцию открытия.Задание администраторуКАРТОЧКА ДЛЯ ЗАПОЛНЕНИЯ · ОБРАЗЕЦOpenCode для двух пользователейДве отдельные рабочие папкиЛичный способ входа
Администратор устанавливает агент и выдаёт точную инструкцию открытия.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

инструкцию OpenCode для Windows

Кто делает: Администратор; сотрудники выполняют пробу.

Полная инструкция и помощь

На входе: Внутренний чат прошёл пилот. Назначены два пользователя агента.

Действие:

  1. Передайте администратору: «Установите один харнес — для этого примера OpenCode. Дайте каждому пилотному пользователю отдельную среду, рабочую папку и способ её открыть. В каждую положите учебные brief.txt и tasks.txt. Настройте разовые подтверждения инструментов».
  2. Получите индивидуальную инструкцию: ярлык или точные действия входа на сервер, путь рабочей папки и команда запуска. Если установка на Windows, администратор использует инструкцию OpenCode для Windows; команды Homebrew с Mac туда не переносятся.
  3. Администратор создаёт в среде А вымышленный файл only-a.txt, разрешённый только А. Из среды Б проверяет чтение этого файла через инструмент.

На выходе: У каждого есть понятный вход в свою среду; данные, история и секреты разделены.

Проверка: Оба пользователя могут открыть свою папку. Чтение only-a.txt из среды Б даёт отказ на уровне системы; одной фразы агента «не могу» недостаточно.

Б2. Выдайте карточку подключения модели

Заполняет администратор. Base URL: фактический адрес API. Model ID: точное имя из сервера. Персональная авторизация. Попросите три значения. Секрет не вписывайте в общую памятку.Заполняет администраторКАРТОЧКА ДЛЯ ЗАПОЛНЕНИЯ · ОБРАЗЕЦBase URL: фактический адрес APIModel ID: точное имя из сервераПерсональная авторизация
Попросите три значения. Секрет не вписывайте в общую памятку.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

А2

Кто делает: Администратор заполняет конфигурацию; сотрудник проверяет.

Полная инструкция и помощь

На входе: Две отдельные среды агента; сервер vLLM работает.

Действие:

  1. Попросите администратора заполнить карточку ниже фактическими значениями и установить настройки в харнес. Для OpenCode это файл opencode.json в рабочей папке по структуре А2, с корпоративными адресом, именем и авторизацией.
  2. Администратор проверяет доступ из самой среды агента, персональную авторизацию и журналирование. Если защищённого шлюза ещё нет, его развёртывание выполняется до выдачи доступа.
  3. Откройте агент по выданной инструкции и напишите: «Ответь одним словом: готов». Повторите под второй учётной записью.

На выходе: Оба агента отвечают через корпоративную модель; администратор различает их запросы в журнале.

Поле Кто и откуда получает
Base URL Администратор выдаёт HTTPS-адрес внутреннего API; адрес должен быть доступен из среды агента
Model ID Администратор берёт поле id из ответа этого API на /models
Авторизация Администратор выдаёт каждому персональный доступ через принятый в компании способ
Открыть агента Полный путь к ярлыку или точная команда на конкретной машине

Пароль входа в чат и API-ключ — разные вещи. 127.0.0.1 в учебном файле относится к машине агента, а не к корпоративному серверу.

Проверка: Вы видите ответ; администратор показывает две записи с разными пользователями. URL чата Open WebUI нельзя просто подставить вместо URL vLLM.

▶ Видео к шагу: Администратору: vLLM и API · с 06:23

Б3. Подключите файлы и поиск

Запрос администратору. Подключить разрешённую коллекцию. Выдать имя инструмента поиска. Дать проверочный вопрос. Поиск Open WebUI не переносится в агент автоматически. Нужно отдельное соединение.Запрос администраторуКАРТОЧКА ДЛЯ ЗАПОЛНЕНИЯ · ОБРАЗЕЦПодключить разрешённую коллекциюВыдать имя инструмента поискаДать проверочный вопрос
Поиск Open WebUI не переносится в агент автоматически. Нужно отдельное соединение.
Кадр 1 из 3

Кто делает: Администратор соединяет; сотрудник проверяет.

Полная инструкция и помощь

На входе: Агенты отвечают через корпоративную модель; папки разделены.

Действие:

  1. В агенте попросите прочитать brief.txt и tasks.txt, как в А3. Проверьте первые строки. Это проверка файлового инструмента.
  2. Для поиска по коллекции передайте администратору: «Подключите поиск к этой среде агента с правами моего пользователя. Выдайте точное имя инструмента, название коллекции и один проверочный запрос».
  3. Спросите агенту: «Используй подключённый поиск: сколько участников в учебном проекте Маяк? Дай цитату и источник». Откройте результат вызова инструмента и исходный документ.
  4. Администратор повторяет тот же поиск с учётной записью, которой коллекция запрещена.

На выходе: Файлы доступны через чтение; коллекция — через отдельно подключённый поиск.

Коллекция Open WebUI не появляется в OpenCode автоматически. Если готового соединения нет, администратор должен подобрать или разработать адаптер. До этого можно завершить файловое упражнение; отметку «поиск подключён» не ставьте.

Проверка: Разрешённый поиск возвращает 12 участников и ссылку на brief.txt. Запрещённый не возвращает текст этого файла. Права проверяются до передачи результата модели.

Б4. Подключите одну бизнес-систему

Учебная запись CRM · образец. Название: Пилот ИИ — Маяк. Статус: Новый. ID: выдаёт администратор CRM. Владелец CRM создаёт запись в тестовой среде и передаёт её ID.Учебная запись CRM · образецКАРТОЧКА ДЛЯ ЗАПОЛНЕНИЯ · ОБРАЗЕЦНазвание: Пилот ИИ — МаякСтатус: НовыйID: выдаёт администратор CRM
Владелец CRM создаёт запись в тестовой среде и передаёт её ID.
Кадр 1 из 3
Команды, файлы и ссылки этого шага

Подключение MCP в OpenCode

Кто делает: Администратор интеграции вместе с владельцем системы.

Полная инструкция и помощь

На входе: Выбрана конкретная система, например ваша CRM; её администратор согласовал учебную запись.

Действие:

  1. Попросите владельца CRM создать в тестовой среде запись «Пилот ИИ — Маяк» с согласованным ID и полем «Статус: Новый». Сохраните ID и снимок исходных полей.
  2. Передайте заявку: «Подключите чтение этой записи из агента. Укажите систему и версию, официальный источник адаптера, способ запуска или URL MCP, способ входа, точное имя инструмента чтения и разрешённые данные».
  3. Администратор устанавливает адаптер, вводит его команду или URL в настройку MCP выбранного харнеса, настраивает вход и проверяет появление инструментов. Он записывает для сотрудника название инструмента и действие открытия его результата.
  4. В агенте попросите прочитать согласованную запись по её ID. Сверьте поля с самой CRM. Повторите из учётной записи без права чтения.

На выходе: Один реальный инструмент читает одну разрешённую запись.

Почему здесь нет одной универсальной кнопки: 1С, разные CRM и календари используют разные подключения. Если исполнитель не может назвать подходящий адаптер, сначала нужны его выбор или разработка, срок и оценка стоимости. До этого шага инструмент ещё не установлен. Адрес MCP относится к инструменту; /v1 относится к модели. Подключение MCP в OpenCode.

Проверка: В истории есть вызов инструмента, возвращены «Пилот ИИ — Маяк» и «Новый». Ограниченная учётная запись получает отказ. Сам ответ модели без обращения к CRM не доказывает интеграцию.

Б5. Настройте подтверждение изменений

Учебная CRM · исходная запись. Пилот ИИ — Маяк. Статус: Новый. Только тестовая среда. Сохраните исходный статус перед пробой.Учебная CRM · исходная записьКАРТОЧКА ДЛЯ ЗАПОЛНЕНИЯ · ОБРАЗЕЦПилот ИИ — МаякСтатус: НовыйТолько тестовая среда
Сохраните исходный статус перед пробой.
Кадр 1 из 3

Кто делает: Администратор настраивает; сотрудник подтверждает или отменяет.

Полная инструкция и помощь

На входе: Чтение учебной записи работает. Администратор разрешил тест записи в тестовой системе.

Действие:

  1. Попросите администратора включить подтверждение операций записи в харнесе и ограничить доступ на стороне CRM. Он должен показать, где видно планируемое изменение и где нажать «Отмена» и «Разрешить» в установленной версии.
  2. Дайте агенту задачу: «Подготовь смену статуса учебной записи с Новый на Проверен. Запроси моё подтверждение перед записью». Когда появится запрос, выберите отменить / отклонить. Откройте CRM: статус должен остаться «Новый».
  3. Повторите и разрешите только это изменение учебной записи. Обновите карточку в CRM и сверьте журнал. Если запрос подтверждения не появился, остановите пробу и верните настройку администратору.

На выходе: Вы управляете записью в систему; отмена и подтверждение имеют проверенный эффект.

Проверка: После отмены — «Новый»; после разрешения — «Проверен». Журнал содержит пользователя и изменение. Фраза «спроси разрешение» в тексте задания без технических настроек не заменяет контроль.

Б6. Примите весь маршрут

Два источника для одной задачи. brief.txt о Маяке. Учебная запись CRM. Пустой файл результата. Используйте проверенные документ и ID записи из Б4.Два источника для одной задачиbrief.txt о Маяке↓Учебная запись CRM↓Пустой файл результата
Используйте проверенные документ и ID записи из Б4.
Кадр 1 из 3

Кто делает: Новый пилотный сотрудник; администратор наблюдает журнал.

Полная инструкция и помощь

На входе: Работают модель, файлы, поиск и чтение CRM. Проверены права и подтверждения.

Действие:

  1. В агенте дайте задачу: «Найди разрешённый brief.txt о Маяке и учебную запись CRM по нашему тестовому ID. Сохрани pilot-result.md: дату и время встречи, число участников, название и текущий статус записи. Укажи источники. Ничего не изменяй в CRM и не отправляй». Вставьте фактический ID из Б4.
  2. Откройте pilot-result.md в рабочей папке независимо от диалога агента. Сверьте с документом и CRM.
  3. Администратор показывает цепочку вызовов: поиск / чтение → чтение CRM → создание файла. Он проверяет отсутствие записи или отправки и повторяет тест прав.
  4. Повторите нагрузочные серии шага 8 с этой агентской задачей, записав время всей задачи и число обращений к модели.

На выходе: Получен файл, в котором объединены проверенные данные документа и CRM. Есть измеренная вместимость агентского сценария.

Проверка: В файле: 15 октября, 11:00, 12 участников, Пилот ИИ — Маяк, Проверен (если успешно выполнен Б5). Источники открываются, в CRM изменений от этой задачи нет. При провале любого пункта вернитесь к соответствующему подключению; общий статус «готово» ещё не ставьте.

2.7. Видео к инструкции

Сотруднику — первый ролик про окно чата. Администратору — видео про vLLM и API.

Смотрите нужный эпизод, возвращайтесь к карточке шага и выполняйте её проверку. Модель, адреса и команды берите из нашей инструкции; отличия каждого ролика подписаны ниже. Видео открываются на сайте автора в новой вкладке.

Обложка видео: Open WebUI для локальных AI моделей
Русский · Java coding interview

Первый вход и первое сообщение в Open WebUI

К инструкции: Корпоративная сборка · шаг 5

Что смотреть. С 06:00 — интерфейс и первый вход; с 07:10 — проба модели. Администратору может пригодиться установка с 02:05.

Как применить у нас. В ролике Open WebUI соединён с Ollama. В нашей компании движок — vLLM: адрес, авторизацию и модель выдаёт администратор.

Смотреть с 06:00 ↗
Название у автора

Open WebUI для локальных AI моделей

Обложка видео: ULTIMATE Llama 3 UI: Dive into Open WebUI & Ollama!
Английский · AI DevBytes

Ориентируемся в возможностях Open WebUI

К инструкции: Документы и чат · шаги 5–6

Что смотреть. Обзор интерфейса как дополнительная ориентация перед работой с документами. Ролик включён в видеогалерею документации Open WebUI.

Как применить у нас. Показаны Llama 3 и Ollama, интерфейс может отличаться. Коллекцию, права отделов и проверку источников настраивайте по шагу 6. Поиск внутри чата подключается к агенту отдельно, по Б3.

Смотреть видео ↗ Страница автора / источник подборки ↗
Название у автора

ULTIMATE Llama 3 UI: Dive into Open WebUI & Ollama!

Обложка видео: Building Local AI: Getting Started with vLLM
Английский · Probably Private

Администратору: модель на GPU и доступ через API

К инструкции: Корпоративная сборка · шаг 5; харнес · Б2

Что смотреть. С 06:23 — запуск vLLM Serve; с 07:54 — обращение через совместимый API; с 08:54 — тестовый запрос.

Как применить у нас. Это демонстрация запуска и соединения машин. Для компании отдельно нужны персональный доступ, изоляция, резервная копия и замер нагрузки по нашей инструкции. Модель здесь выбирает администратор: Qwen3.8-27B-FP8.

Смотреть с 06:23 ↗
Название у автора

Building Local AI: Getting Started with vLLM

Подборка проверена 11.10.2026 по описаниям, главам и страницам авторов; названия подтверждены метаданными YouTube. Для перевода используйте субтитры и автоперевод, если они доступны в плеере.

3. Как проверить результат

Работающий чат подтверждает базовый запуск. Поиск принимайте по проверенным источникам и правам доступа, агента — по выполненной задаче, корпоративную мощность — по измеренной нагрузке на реальных запросах.

Если что-то не получилось

Что вы видите Что проверить и сделать Как понять, что исправлено
command not found Команда введена в Терминал? Завершена установка? Для brew выполнены её Next steps? Откройте новую вкладку и повторите проверку версии Появился номер версии
«Файл не найден», No such file Откройте Finder → ⌘ Shift G → ~/Models. Сверьте точное имя GGUF; оно не должно иметь (1) или временное расширение Файл есть по пути из команды; сервер его загружает
Страница чата не открывается / connection refused На том же ли компьютере открыт браузер? Работает ли вкладка llama-server? Посмотрите её последнюю ошибку; повторите запуск только после устранения причины Открывается чат по адресу без /v1
На странице JSON, 404 или Not Found Не перепутаны ли адрес чата и адрес API? Для личного Mac чат — http://127.0.0.1:8080; корпоративный адрес выдаёт администратор Видно поле ввода сообщения
address already in use Порт уже занят. Сначала проверьте, не работает ли чат; не запускайте вторую копию. Если порт занят другой программой, настройщик согласует новый порт во всех настройках Одна работающая копия сервера и согласованный адрес
out of memory, программа закрылась Закройте лишние приложения, используйте короткий тест с контекстом 8192. Передайте настройщику объём памяти, файл модели и ошибку Сервер устойчиво отвечает на короткий запрос; при нехватке подбирается меньшая модель
В агенте 401 / 403 401 обычно указывает на авторизацию, 403 — на запрет доступа. Администратор проверяет персональный ключ и права; не копируйте секреты в обращение Тестовый запрос разрешённому пользователю проходит
context length exceeded / слишком длинный запрос Начните новый диалог командой /new и повторите короткий тест. Если даже он не помещается, настройщик согласует размер контекста в llama-server и limit.context в opencode.json с доступной памятью Короткая задача выполняется без переполнения; длинные файлы пока не добавляются
Агент предлагает облачную модель Проверьте запуск из AI-pilot и наличие именно opencode.json. Перезапустите из этой папки; сравните имя модели Запрос виден в локальном сервере
Агент пишет «сохранил», файла нет Раскройте вызов инструмента: была ли запись и разрешили ли вы её? Если вызова нет, настройщик проверяет tool calling Файл открывается в Finder / файловом менеджере
MCP не запустился Для браузерного примера проверьте версии node и npx, доступ к загрузке пакета и сообщение MCP. Если нужен браузер — завершите его установку В истории есть реальный вызов Playwright
Документ есть, ответа по нему нет Выбрана ли коллекция, завершена ли обработка, есть ли читаемый текст и право доступа? Передайте администратору имя файла и запрос Появились верная цитата и открываемый источник
После перезагрузки всё исчезло Программы нужно снова запустить: сначала модель, потом агент из своей папки. Для компании используйте паспорт системы Те же файлы сохранились; чат и агент снова отвечают

Что отправить настройщику: номер шага, ОС, версии программ, точное действие, текст ошибки и снимок экрана без ключей и паролей. Не отмечайте шаг выполненным, пока не пройдена его проверка.

Статус инструкции: команды и поля сверены с указанной официальной документацией 11.10.2026. Учебные данные и конфигурации подготовлены для проверки. На вашем оборудовании установка модели и проба инструментов ещё должны быть выполнены; схема и готовый файл настройки не заменяют успешного запуска.

Учебная схема экрана