По итогам обсуждения на реюнионе ЕМБА 10 октября 2026 года.
Если вы хотите работать со своими документами внутри личного или корпоративного контура, можно развернуть модель у себя. В качестве ориентира возьмём Qwen3.8-27B. Это модель для текста, кода и изображений. Локальный запуск означает, что сама модель работает на вашем компьютере или сервере. Чтобы данные действительно оставались внутри контура, интерфейс, хранение файлов и подключённые инструменты тоже должны быть настроены соответствующим образом.
Как читать: выберите личный или корпоративный маршрут. Цены и нагрузку проверяйте перед закупкой: это ориентиры на 11 октября 2026 года, а не коммерческое предложение.
Первый раз здесь? Начните со сборки, каталоги можно прочитать позже.
Как пройти по картинкам: у каждого шага переключайте «До шага → Сделайте → Получится». Оранжевая рамка показывает место действия; зелёная отметка — пример ожидаемого результата. Это учебные схемы, а не снимки вашей установленной программы. Кнопка «Увеличить» раскрывает схему. На кадре «Сделайте» автоматически открываются точные команды и ссылки; полный текст доступен в «Полная инструкция и помощь». Переключение кадров ничего не устанавливает: действия выполняйте в указанной программе, затем сравнивайте результат.
Здесь мы собираем один учебный комплект. Сначала появится чат, затем агент научится читать два файла и создавать третий. Покупать и устанавливать все программы из каталогов не нужно.
Семь слов, которые встретятся дальше
Слово
Что это в нашей сборке
Что появляется у вас
Модель
Qwen: вычисляет ответ на переданный текст
Большой скачанный файл; сам по себе не открывает чат
Движок / сервер модели
llama.cpp на Mac или vLLM на NVIDIA: запускает модель
Работающая программа, которая принимает запросы
Чат
Окно для переписки с моделью
Страница в браузере
API / Base URL
Адрес для связи двух программ
Строка настройки, например адрес с /v1; это не страница чата
Харнес
Программа, которая даёт модели инструменты и выполняет её шаги
В учебном примере — OpenCode в отдельной вкладке Терминала
Инструмент / MCP
Инструмент читает файл или открывает сайт; MCP подключает дополнительные инструменты
Видимый вызов действия и его результат в истории агента
Skill / навык
Сохранённый порядок выполнения задачи
Маленький файл SKILL.md; сам программы не устанавливает
Q8 GGUF и FP8 — разные форматы хранения модели для разных программ запуска. В учебных шагах уже выбран нужный файл: пересчитывать и выбирать формат самостоятельно не требуется.
Практический результат ведущего: на его RTX 4090, доработанной до 48 ГБ, Qwen3.8-27B обслуживала до 15 одновременных запросов. Исследование скорости работы Qwen3.8-27B ↗. Это результат конкретного стенда; в памятке не зафиксированы формат весов, длина запросов и время ожидания. При выборе другого оборудования и нагрузки эти параметры измеряют заново.
Как запустить
Для NVIDIA с 48 ГБ видеопамяти основной вариант — Qwen3.8-27B-FP8 ↗ через vLLM ↗. Для Mac mini / MacBook с 48 ГБ объединённой памяти начните с Q8 GGUF ↗ через llama.cpp ↗: это простой воспроизводимый маршрут для локального чата. Затем можно сравнить MLX 8-bit ↗, сборку под Apple Silicon. Q8 занимает около 29 ГБ, BF16 — около 54 ГБ ещё до расхода памяти на контекст и программу; на 48 ГБ BF16 целиком не помещается. Q4 оставьте для устройств с меньшим запасом памяти или когда важнее скорость, чем точность.
Что можно делать
Вести диалог, готовить черновики писем и документов, разбирать тексты, помогать себе с кодом. Для работы с папками и корпоративными материалами понадобится дополнительный интерфейс и настройка доступа. Модель сама по себе не получает доступ к вашим файлам и не запоминает их навсегда после разговора.
Границы
Локальная модель может уступать самым сильным облачным моделям в сложной инженерной работе. Она не знает свежие новости без подключённого источника данных. Большие документы и длинные рассуждения требуют больше памяти и времени. Поэтому сначала проверьте качество именно на своих типовых задачах.
MacBook и Mac mini используют одну инструкцию ниже. Для ПК с NVIDIA есть отдельная краткая инструкция. Начальный результат — текстовый чат; картинки, документы и агент подключаются после проверки базы.
Для первого запуска: переходите к сборке, затем к агенту. Каталоги выше нужны, если вы хотите сравнить альтернативы.
1.2. Модели и программы
Основной маршрут на Mac: Qwen3.8-27B Q8 GGUF + llama.cpp; на NVIDIA: Qwen3.8-27B FP8 + vLLM. Для уже имеющегося ноутбука с 16–24 ГБ можно отдельно попробовать Qwen3.5-9B через Ollama; покупать устройство из сметы для этой пробы не требуется.
Модель — это файл с обученными весами. Обвязка — программа, которая его запускает и даёт окно для работы. Открытые веса можно скачать, но правила использования зависят от лицензии. Наличие файла модели само по себе не даёт чат, поиск по документам или права доступа.
1. Выберите модель
Четыре понятных кандидата для старта. Это подборка для сравнения на ваших задачах, а не рейтинг всех существующих моделей. B означает миллиарды параметров, а не гигабайты памяти.
Лёгкий старт
Qwen3.5 · 9B
Текст, код и изображения. Кандидат для первых опытов на ноутбуке; проверьте на своих письмах, таблицах и сканах.
Планируйте 16–24 ГБ памяти устройства для пробного запуска с коротким контекстом. Это ориентир, а не минимальное требование.
Что выбрать: на Mac — Qwen3.8-27B-Q8_0.gguf; на NVIDIA — vllm serve Qwen/Qwen3.8-27B-FP8 после установки vLLM.
Сборка GGUF опубликована командой ggml-org. Для картинок также нужен совместимый mmproj из этого репозитория; поддержка зависит от версии приложения. FP8 — тоже снижение точности весов до 8 бит, а не исходная BF16; по памяти и точности это другой класс, чем Q4.
Текст + картинки
Gemma 3 · 12B IT
Модель Google для диалога, кратких изложений и разбора изображений. Вариант для сравнения качества с Qwen на одной подборке задач.
Для старта в Q4 планируйте 16–24 ГБ памяти. Длинные документы и изображения увеличивают расход.
Какой файл или команду выбрать:ollama run gpt-oss:20b
Команда выполняется в терминале после установки Ollama. Первая загрузка требует интернета; затем модель можно запускать локально.
Как понимать память. Q4 — веса около 4 бит, FP8 и Q8 — около 8 бит, BF16 — 16 бит. Размер скачанного файла меньше общего расхода памяти: дополнительно нужны контекст, изображения и программа. У Apple используется объединённая память; у ПК важны отдельно RAM и видеопамять. Начните с короткого диалога. Если памяти не хватает, уменьшите контекст или выберите меньшую модель.
2. Выберите обвязку
В инструкции для Mac ниже используется llama.cpp. Если хотите приложение с кнопками, LM Studio — отдельная альтернатива со своей инструкцией в карточке. Для NVIDIA используется vLLM. При смене движка следуйте его инструкции, а не командам llama-server.
МОДЕЛЬ → LM Studio → ЧАТ
Приложение для себя
LM Studio
Поиск и загрузка моделей, обычный чат и работа с документами в одном окне. Удобный первый маршрут для Mac, Windows и Linux.
Установить → Discover → найти модель → Download → Chat → Load. На Mac с 48 ГБ выбирайте совместимую сборку Q8.
Готовое приложение; условия использования LM Studio.
Откройте карточку разработчика. В Hugging Face файлы находятся на вкладке Files and versions; в Ollama используйте точное имя и размер модели.
2Совместимый формат
Для llama.cpp — GGUF. Для LM Studio — поддерживаемая сборка из поиска приложения. Для vLLM — веса и рецепт запуска из карточки модели; GGUF не универсален.
3Пробный результат
Задайте одинаковые вопросы двум моделям. Проверьте русский язык, ответы по документу и скорость. Затем отключите интернет и повторите локальный запрос.
Лицензии и источники. У Qwen и gpt-oss в этой подборке — Apache 2.0; у Gemma — собственные условия ↗. LM Studio распространяется по · условиям приложения ↗. Для Open WebUI проверьте · условия брендинга ↗. Ссылки на первоисточники приведены рядом с описаниями.
1.3. Агентские оболочки
Добавьте агентскую оболочку, когда ИИ должен выполнять задачу в несколько шагов: читать файлы, пользоваться программами и проверять результат.
Харнес (harness) — среда работы агента. Он передаёт задачу модели, хранит ход работы, вызывает инструменты и возвращает модели результат каждого действия. Модель выбирает следующий шаг; харнес организует его выполнение в пределах заданных прав.
МодельQwen, Gemma, gpt-ossПредлагает ответы и следующие действия
ДвижокOllama, LM Studio, vLLMЗапускает модель и принимает запросы
ХарнесOpenClaw, Hermes, OpenCode…Управляет шагами и вызовами инструментов
ИнструментыФайлы, браузер, терминал, MCPЧитают данные и выполняют действия
С чего начать
В учебной сборке ниже используем OpenCode для чтения и создания файлов. Если нужен помощник в мессенджере или другая среда работы, отдельно рассмотрите OpenClaw или Hermes. Для сайтов, скриптов и работы с кодом — OpenCode; если уже пользуетесь VS Code, рассмотрите Cline. Для небольших правок через терминал — Aider.
OpenClaw
Помощник в привычных каналах
OpenClaw
Агент на вашем компьютере или сервере. Принимает задачи через чат и мессенджеры, использует инструменты, навыки и автоматизации.
Пример задачи. Собрать сводку из разрешённой папки и подготовить черновик ответа.
С локальной моделью. Подключается к локальному Ollama через его родной API. В настройках OpenClaw нужен адрес без /v1.
С чего начать
Установка → первоначальная настройка → выбор модели → подключение одного канала.
Агент Nous Research с памятью между сессиями, повторно используемыми навыками, расписанием и подключением мессенджеров. Есть приложение и терминал.
Пример задачи. Запомнить формат сводки и использовать его при следующей подготовке отчёта.
С локальной моделью. Можно подключить LM Studio или собственный сервер Ollama / vLLM через совместимый endpoint. Hermes Agent — программа; модель выбирается отдельно.
С чего начать
Установить → выбрать провайдера командой hermes model → указать модель → открыть рабочую папку.
Читает проект, предлагает изменения, редактирует файлы и запускает команды. Доступен в терминале, приложении и интеграциях с редактором.
Пример задачи. Добавить кнопку в сайт, изменить код и проверить результат.
С локальной моделью. Поддерживает локальный Ollama и совместимые API. Для Ollama в документации OpenCode используется адрес с /v1; выбирайте модель, умеющую вызывать инструменты.
С чего начать
Установить → открыть папку проекта → подключить провайдера → выбрать модель → дать небольшую задачу.
В учебном маршруте начните с OpenCode через совместимый API: подробности в необязательном шаге 8 сборки. Для OpenClaw и остальных агентов используйте инструкцию конкретного провайдера; наличие поддержки Ollama не означает одинаковую настройку llama.cpp.
Основной стек: выбранный харнес → API llama-server → Qwen3.8-27B
Базовый чат llama-server остаётся доступен. Open WebUI нужен только для дополнительного интерфейса и поиска по документам. Харнес подключается к серверу модели отдельно и получает свои инструменты. Работающий чат ещё не доказывает, что модель надёжно выполняет многошаговые задания и вызовы инструментов.
1Подключите модель
Выберите локальный или внутренний сервер в настройках провайдера. Название модели должно совпадать с установленным. Адрес и формат API берите из инструкции конкретного харнеса.
2Дайте одну задачу
Создайте пробную папку с копиями двух-трёх документов. Попросите составить обзор и сохранить его в новый файл. Проверьте результат и список действий перед подключением остальных папок.
3Проверьте итог
Откройте созданный файл, сравните с исходниками и посмотрите выполненные действия. Для отправки сообщений, удаления и изменений во внешних системах настройте подтверждение.
Что учитывать в бюджете и настройке. Открытый код оболочки не включает стоимость облачных моделей и внешних инструментов. При локальной модели остаются расходы на оборудование и обслуживание. Для полностью внутреннего сценария проверьте также вспомогательные модели, поиск, мессенджеры и интеграции: Telegram или внешний веб-поиск обращаются во внешние сервисы. Поддержку вашей модели и нужных инструментов проверяйте в небольшом пилоте.
Официальные источники указаны рядом с описаниями. Проверено 11 октября 2026 года.
1.4. Бюджет
Для первого личного запуска я бы выбрал Mac mini M4 Pro с 48 ГБ и Q8 GGUF, если мобильность не нужна. Вариант с 64 ГБ даст запас для длинного контекста и многозадачности; его цену рассчитывают отдельно. Для поездок — MacBook Pro. ПК с модифицированной RTX 4090 имеет смысл при конкретной потребности в NVIDIA/CUDA и работе через FP8 + vLLM. Ниже — цены на страницах продавцов и отдельно расчётные резервы. Наличие не подтверждено заказом; доставка и условия оплаты согласуются с магазином.
СТАЦИОНАРНОЕ РАБОЧЕЕ МЕСТО
Mac mini M4 Pro
48 ГБ объединённой памяти · SSD 512 ГБ
≈ 260–350 тыс. ₽
Полный старт: компьютер, периферия и резерв на настройку
Компьютер: ориентир 220–300 тыс. ₽.
Монитор, клавиатура и мышь: резерв 25–40 тыс. ₽.
Настройка: резерв 10–20 тыс. ₽; самостоятельно — 0 ₽ за услуги.
Только карта: 438 230 ₽ наличными или 486 922 ₽ безналично.
Остальной ПК: расчётный резерв 100–180 тыс. ₽.
Периферия: 25–40 тыс. ₽; сборка и настройка: 20–40 тыс. ₽.
G.Race ↗ · поставка из Китая 21–28 дней. При безналичной оплате итог увеличится примерно на 49 тыс. ₽. Цена: G.Race. Нужны условия гарантии именно на модификацию и тест под вашей моделью. Цена системного блока — моя оценка, предложения на сборку пока нет.
Программная часть и дальнейшие расходы
Для стартового стека Mac: локальная модель → llama.cpp ↗ → браузерный интерфейс. Этот состав соответствует шагам 1–6 сборки. На ПК с NVIDIA вместо llama.cpp используйте FP8 и vLLM. Поиск по документам и агент — необязательные шаги 7–8; стоимость их настройки оценивается отдельно. В этой оценке на стартовое ПО заложено 0 ₽; платные приложения и облачные API не включены.
Настройка 10–20 тыс. ₽ для Mac и 20–40 тыс. ₽ для ПК — мой бюджетный резерв, не найденный прайс подрядчика. В него предполагаются установка, тест на небольших текстах, которые вы вставляете в чат, и проверка локальности. Сложные интеграции с корпоративными системами сюда не входят.
Электричество считайте по формуле: мощность в кВт × часы работы × ваш тариф. Пример допущений: при 4 часах в день и 8 ₽/кВт·ч, 60 Вт дают около 58 ₽/месяц, 500 Вт — около 480 ₽/месяц. Это сценарный расчёт, не измерение указанных устройств. Необязательное сопровождение: резерв 0–5 тыс. ₽/месяц.
1.5. Пошаговая сборка
Mac с 48 ГБ → Qwen3.8-27B Q8 GGUF → llama.cpp / llama-server → локальный чат. Шаги 1–6 дают рабочий текстовый чат. Шаги 7–8 — дополнительные возможности. Для MacBook и Mac mini приведены отдельные маршруты сборки; маршрут NVIDIA с FP8 указан после них.
Один шаг — одно действие и проверяемый результат.
Перед командами: как открыть Терминал на Mac
Нажмите ⌘ Пробел, напечатайте Терминал (или Terminal), нажмите Return / Enter. В его окне вставляйте команды из зелёных блоков и нажимайте Return. Кнопка «Копировать» берёт только команду. Текст задания для модели вводится в чат — место ввода всегда подписано.
После обычной команды дождитесь новой строки приглашения (обычно заканчивается % или $). После запуска сервера приглашение не возвращается: окно занято работающей моделью. Для следующих команд откройте Shell → New Tab / Новая вкладка или нажмите ⌘ T. Не вводите команды в окно, где ещё работает сервер.
Маршрут проверяется по частям: установка → файл → чат → агент → файл результата. Если проверка шага не прошла, сначала откройте таблицу ошибок.
Также нужны: интернет для загрузки, 60 ГБ свободного места на SSD. Учебные задания уже даны ниже; затем добавьте свои примеры.
1. Подключите ноутбук
Учебная схема · вид вашей программы может отличаться
Положите ноутбук и зарядку перед собой.Соедините зарядку с ноутбуком и розеткой.Должен появиться рабочий стол. На новом Mac сначала пройдите мастер настройки.
Кадр 1 из 3
Кто делает: Вы.
Полная инструкция и помощь
На входе: Ноутбук из выбранной конфигурации, зарядное устройство и интернет для установки.
Действие: Поставьте MacBook на стол и подключите зарядку. Откройте крышку и включите его.
На выходе: Экран, клавиатура и тачпад уже готовы к работе.
Как именно — подсказка
Эта схема рассчитана на MacBook из памятки с 48 ГБ объединённой памяти. Для ноутбука с Windows сначала нужна отдельная проверка GPU и памяти; эти требования нельзя автоматически переносить на него.
Проверка: Включите ноутбук: виден рабочий стол, индикатор показывает питание от сети.
2. Проверьте свободное место
Учебная схема · вид вашей программы может отличаться
Сначала проверьте память: 48 ГБ или больше. Затем откройте настройки.Выберите «Основные», затем «Хранилище».Нужно проверить оба числа: память и свободное место — разные вещи.
Кадр 1 из 3
Кто делает: Вы.
Полная инструкция и помощь
На входе: Включённый Mac.
Действие:
Нажмите → Об этом Mac: найдите «Память». Этот маршрут рассчитан на Apple Silicon и 48 ГБ или больше.
Откройте → Системные настройки → Основные → Хранилище.
Для учебной установки оставьте не менее 60 ГБ свободного места: файл занимает около 28,6 ГБ, остальное — запас на установку и работу. Это ориентир для этого маршрута, а не требование всех моделей.
На выходе: Вы проверили две разные величины: память компьютера и свободное место диска.
Проверка: В «Об этом Mac» — 48 ГБ или больше; в хранилище — свободно не менее 60 ГБ. Если памяти меньше, не переходите к загрузке Q8: выберите меньшую модель с настройщиком.
3. Установите программу запуска
Учебная схема · вид вашей программы может отличаться
Найдите «Терминал» через ⌘ Пробел. Скопируйте первую команду под картинкой.Вставьте команду установки и нажмите Return. Сервер пока не запускается.Должен появиться номер версии. «command not found» означает, что установка не готова.
Кто делает: Вы; если нет прав установки — настройщик.
Полная инструкция и помощь
На входе: Mac подготовлен; Терминал открыт по подсказке выше; интернет включён.
Действие:
В Терминале выполните проверку:
brew --version
Если показана версия Homebrew, переходите к следующей команде. Если написано command not found, откройте официальную страницу Homebrew, скопируйте команду под Install Homebrew и выполните её в Терминале. Следуйте подсказкам установки, включая Next steps в конце. При вводе пароля Mac символы не видны — это нормально. Откройте новую вкладку Терминала и повторите brew --version.
Установите программу запуска:
brew install llama.cpp
После окончания проверьте:
llama-server --version
На выходе: В Терминале доступна команда llama-server. Пока модель не скачана и чат не запущен.
Основание: установка llama.cpp. Если Homebrew предложил действия, которых вы не понимаете, передайте текст ошибки настройщику; не продолжайте следующую карточку до успешной проверки.
Проверка: Последняя команда выводит версию / номер сборки, а не command not found. Сохраните этот номер, если потребуется помощь.
Учебная схема · вид вашей программы может отличаться
Откройте ссылку на точный файл под картинкой. Сверьте имя.Нажмите download. Затем перенесите файл из «Загрузок» в ~/Models.В папке Models должен лежать готовый GGUF с точным именем, без .download.
Дождитесь завершения в списке загрузок браузера. Откройте Finder → Загрузки и найдите Qwen3.8-27B-Q8_0.gguf.
В Finder нажмите ⌘ Shift G, введите ~/Models, нажмите Return. Переместите скачанный файл в эту папку. Не меняйте имя.
На выходе: Файл лежит в Models внутри вашей домашней папки. Это то место, которое использует следующая команда.
Проверка: В Finder выделите файл → ⌘ I («Свойства»): имя точно Qwen3.8-27B-Q8_0.gguf, размер около 28,6 ГБ. Файл с окончанием .download или .crdownload ещё не готов.
Учебная схема · вид вашей программы может отличаться
Файл уже на месте. Теперь его нужно запустить программой.Скопируйте полную команду ниже. Откройте в браузере http://127.0.0.1:8080.Введите пробу в чат. Ожидается ответ; сервер в Терминале продолжает работать.
Дождитесь окончания загрузки модели. Окно будет занято журналом работы — оставьте его открытым.
На этом же Mac откройте браузер. Нажмите ⌘ L, вставьте http://127.0.0.1:8080 и нажмите Return. Это адресная строка браузера, не поле поиска сайта.
В поле сообщения открывшегося чата введите: «Ответь одним словом: готов». Нажмите кнопку отправки рядом с полем.
На выходе: В браузере открыт локальный чат и появился ответ. local-qwen — короткое имя этой модели для подключения агента.
Что означают адреса:http://127.0.0.1:8080 — чат для вас; http://127.0.0.1:8080/v1 — связь для агента. 127.0.0.1 означает этот компьютер. С телефона или другого ноутбука такой адрес ваш Mac не откроет.
Завтра: повторите эту же команду и откройте тот же адрес. Чтобы выключить модель сейчас, в её окне Терминала нажмите Control C. Закрытие вкладки браузера само по себе сервер не выключает. Начальный контекст ограничен 8192 токенами; длинные документы пока не используйте.
Шаблон запуска нужно проверить на установленной версии: сервер llama.cpp.
Проверка: Ответ виден в браузере, а в оставленном Терминале появились строки обработки запроса. Сообщение об ошибке загрузки модели означает, что шаг ещё не выполнен.
Учебная схема · вид вашей программы может отличаться
Возьмите полный текст пробы под картинкой.Оставьте модель запущенной. Повторите пробу без интернета.Все факты должны совпасть. После проверки верните сеть.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
Встреча «Маяк» назначена на 15 октября в 11:00. Анна готовит смету. Борис бронирует зал. Число участников пока не определено.
Перечисли дату, время, поручения и число участников. Если сведений нет, так и напиши.
Кто делает: Вы.
Полная инструкция и помощь
На входе: Чат ответил; сервер продолжает работать.
Действие:
Вставьте в чат этот учебный текст и задание:
Встреча «Маяк» назначена на 15 октября в 11:00. Анна готовит смету. Борис бронирует зал. Число участников пока не определено.
Перечисли дату, время, поручения и число участников. Если сведений нет, так и напиши.
Сверьте ответ с эталоном ниже.
Отключите Wi-Fi в меню Mac; если подключён сетевой кабель, отключите его тоже. Не останавливайте модель. Начните новый разговор или повторите тот же запрос.
Верните сеть после проверки. Затем проверьте десять коротких примеров из своей работы.
На выходе: Модель отвечает на переданный текст без сети. Вы понимаете, как отличить правильный ответ от выдумки.
Проверка: Должны быть 15 октября, 11:00, Анна — смета, Борис — зал; число участников неизвестно. Формулировки могут отличаться. Сохраните неверные ответы для разбора. Офлайн-проверка относится к этому чату, а не к ещё не установленным внешним инструментам.
Также нужны: интернет для загрузки, 60 ГБ свободного места на SSD. Учебные задания уже даны ниже; затем добавьте свои примеры.
1. Соедините домашний компьютер
Учебная схема · вид вашей программы может отличаться
Разложите компьютер, монитор, кабель и устройства ввода.Подключите экран и устройства ввода, затем питание. Включите монитор и Mac.На мониторе — рабочий стол. Для первого запуска удобнее проводные устройства.
Кадр 1 из 3
Кто делает: Вы.
Полная инструкция и помощь
На входе: Mac mini, питание, монитор, кабель, клавиатура и мышь. Маршрут ПК с NVIDIA описан отдельно ниже.
Действие: Подключите монитор к Mac mini, клавиатуру и мышь — по USB или Bluetooth. Затем подключите питание и включите компьютер.
На выходе: Вы видите рабочий стол и можете управлять курсором.
Как именно — подсказка
Основной маршрут — Mac mini из памятки с 48 ГБ. Нужен подходящий кабель HDMI или USB-C к вашему монитору. Если покупаете новый Mac mini и бюджет позволяет, 64 ГБ дадут больше запаса для длинного контекста и других программ. ПК с RTX 4090 48 ГБ собирайте и проверяйте отдельно: перепайка памяти не входит в эту инструкцию.
Проверка: Монитор показывает рабочий стол, клавиатура и мышь управляют компьютером.
2. Проверьте свободное место
Учебная схема · вид вашей программы может отличаться
Сначала проверьте память: 48 ГБ или больше. Затем откройте настройки.Выберите «Основные», затем «Хранилище».Нужно проверить оба числа: память и свободное место — разные вещи.
Кадр 1 из 3
Кто делает: Вы.
Полная инструкция и помощь
На входе: Включённый Mac.
Действие:
Нажмите → Об этом Mac: найдите «Память». Этот маршрут рассчитан на Apple Silicon и 48 ГБ или больше.
Откройте → Системные настройки → Основные → Хранилище.
Для учебной установки оставьте не менее 60 ГБ свободного места: файл занимает около 28,6 ГБ, остальное — запас на установку и работу. Это ориентир для этого маршрута, а не требование всех моделей.
На выходе: Вы проверили две разные величины: память компьютера и свободное место диска.
Проверка: В «Об этом Mac» — 48 ГБ или больше; в хранилище — свободно не менее 60 ГБ. Если памяти меньше, не переходите к загрузке Q8: выберите меньшую модель с настройщиком.
3. Установите программу запуска
Учебная схема · вид вашей программы может отличаться
Найдите «Терминал» через ⌘ Пробел. Скопируйте первую команду под картинкой.Вставьте команду установки и нажмите Return. Сервер пока не запускается.Должен появиться номер версии. «command not found» означает, что установка не готова.
Кто делает: Вы; если нет прав установки — настройщик.
Полная инструкция и помощь
На входе: Mac подготовлен; Терминал открыт по подсказке выше; интернет включён.
Действие:
В Терминале выполните проверку:
brew --version
Если показана версия Homebrew, переходите к следующей команде. Если написано command not found, откройте официальную страницу Homebrew, скопируйте команду под Install Homebrew и выполните её в Терминале. Следуйте подсказкам установки, включая Next steps в конце. При вводе пароля Mac символы не видны — это нормально. Откройте новую вкладку Терминала и повторите brew --version.
Установите программу запуска:
brew install llama.cpp
После окончания проверьте:
llama-server --version
На выходе: В Терминале доступна команда llama-server. Пока модель не скачана и чат не запущен.
Основание: установка llama.cpp. Если Homebrew предложил действия, которых вы не понимаете, передайте текст ошибки настройщику; не продолжайте следующую карточку до успешной проверки.
Проверка: Последняя команда выводит версию / номер сборки, а не command not found. Сохраните этот номер, если потребуется помощь.
Учебная схема · вид вашей программы может отличаться
Откройте ссылку на точный файл под картинкой. Сверьте имя.Нажмите download. Затем перенесите файл из «Загрузок» в ~/Models.В папке Models должен лежать готовый GGUF с точным именем, без .download.
Дождитесь завершения в списке загрузок браузера. Откройте Finder → Загрузки и найдите Qwen3.8-27B-Q8_0.gguf.
В Finder нажмите ⌘ Shift G, введите ~/Models, нажмите Return. Переместите скачанный файл в эту папку. Не меняйте имя.
На выходе: Файл лежит в Models внутри вашей домашней папки. Это то место, которое использует следующая команда.
Проверка: В Finder выделите файл → ⌘ I («Свойства»): имя точно Qwen3.8-27B-Q8_0.gguf, размер около 28,6 ГБ. Файл с окончанием .download или .crdownload ещё не готов.
Учебная схема · вид вашей программы может отличаться
Файл уже на месте. Теперь его нужно запустить программой.Скопируйте полную команду ниже. Откройте в браузере http://127.0.0.1:8080.Введите пробу в чат. Ожидается ответ; сервер в Терминале продолжает работать.
Дождитесь окончания загрузки модели. Окно будет занято журналом работы — оставьте его открытым.
На этом же Mac откройте браузер. Нажмите ⌘ L, вставьте http://127.0.0.1:8080 и нажмите Return. Это адресная строка браузера, не поле поиска сайта.
В поле сообщения открывшегося чата введите: «Ответь одним словом: готов». Нажмите кнопку отправки рядом с полем.
На выходе: В браузере открыт локальный чат и появился ответ. local-qwen — короткое имя этой модели для подключения агента.
Что означают адреса:http://127.0.0.1:8080 — чат для вас; http://127.0.0.1:8080/v1 — связь для агента. 127.0.0.1 означает этот компьютер. С телефона или другого ноутбука такой адрес ваш Mac не откроет.
Завтра: повторите эту же команду и откройте тот же адрес. Чтобы выключить модель сейчас, в её окне Терминала нажмите Control C. Закрытие вкладки браузера само по себе сервер не выключает. Начальный контекст ограничен 8192 токенами; длинные документы пока не используйте.
Шаблон запуска нужно проверить на установленной версии: сервер llama.cpp.
Проверка: Ответ виден в браузере, а в оставленном Терминале появились строки обработки запроса. Сообщение об ошибке загрузки модели означает, что шаг ещё не выполнен.
Учебная схема · вид вашей программы может отличаться
Возьмите полный текст пробы под картинкой.Оставьте модель запущенной. Повторите пробу без интернета.Все факты должны совпасть. После проверки верните сеть.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
Встреча «Маяк» назначена на 15 октября в 11:00. Анна готовит смету. Борис бронирует зал. Число участников пока не определено.
Перечисли дату, время, поручения и число участников. Если сведений нет, так и напиши.
Кто делает: Вы.
Полная инструкция и помощь
На входе: Чат ответил; сервер продолжает работать.
Действие:
Вставьте в чат этот учебный текст и задание:
Встреча «Маяк» назначена на 15 октября в 11:00. Анна готовит смету. Борис бронирует зал. Число участников пока не определено.
Перечисли дату, время, поручения и число участников. Если сведений нет, так и напиши.
Сверьте ответ с эталоном ниже.
Отключите Wi-Fi в меню Mac; если подключён сетевой кабель, отключите его тоже. Не останавливайте модель. Начните новый разговор или повторите тот же запрос.
Верните сеть после проверки. Затем проверьте десять коротких примеров из своей работы.
На выходе: Модель отвечает на переданный текст без сети. Вы понимаете, как отличить правильный ответ от выдумки.
Проверка: Должны быть 15 октября, 11:00, Анна — смета, Борис — зал; число участников неизвестно. Формулировки могут отличаться. Сохраните неверные ответы для разбора. Офлайн-проверка относится к этому чату, а не к ещё не установленным внешним инструментам.
Если у вас ПК с NVIDIA 48 ГБ
Это отдельный маршрут с настройщиком. Открытие /v1 в браузере не создаёт чат. Передайте настройщику такое задание:
Подготовьте на совместимой NVIDIA 48 ГБ Linux, драйвер и vLLM с моделью Qwen/Qwen3.8-27B-FP8. Установите Open WebUI и соедините его с моделью. Передайте мне адрес чата, способ входа, адрес API для агента, точное Model ID, способ запуска после перезагрузки и ваш контакт. Проверьте текстовый запрос и один вызов файлового инструмента из выбранного харнеса.
Что получаете: две разные строки — «открыть чат в браузере» и «вставить API в настройки агента». Адреса заполняет настройщик после установки. Без них переходить к агенту рано.
Что проверяете сами: войдите по адресу чата, вставьте пример про встречу «Маяк» из шага 6 выше, сверьте пять фактов. Для офлайн-проверки ПК с моделью и экраном на одной машине отключите внешнюю сеть после установки. Если модель на другом сервере, оставьте локальную сеть включённой, а доступ в интернет отключает администратор.
Это шаблон первого текстового запуска, не готовая многопользовательская установка. Подберите длину контекста под видеопамять. API — http://127.0.0.1:8000/v1 только для клиента на том же хосте. Уточните Model ID по /v1/models; у контейнера свой localhost. Для агентов отдельно настройте совместимый шаблон и парсер tool calling vLLM. Версии и параметры запишите в карточку подключения.
Если хотите сравнить MLX на Mac
MLX Community публикует Qwen3.8-27B-8bit ↗ размером около 29,5 ГБ. Это нативный для Apple Silicon вариант, который имеет смысл сравнить с Q8 GGUF на одних и тех же 10 задачах: качество, скорость и расход памяти. Для текста и изображений смотрите инструкцию mlx-vlm в карточке модели. Стандартный CUDA-маршрут vLLM для Mac не подходит; существует отдельный vLLM Metal ↗ на базе MLX. Для первого личного запуска он усложняет настройку без необходимости.
Продолжение: документы и действия
Эти шаги можно пропустить, если достаточно чата. Они не включены автоматически в базовую стоимость настройки.
7. Подключите документы · по желанию
Учебная схема · вид вашей программы может отличаться
Для первого документа достаточно скопировать короткий текст.Вставьте документ и вопрос в поле сообщения.Правильный ответ подтверждается строкой исходного документа.
На входе: Работающий чат. Маленький текст, который вы можете открыть и прочитать сами.
Действие:
Для первого документа откройте его в редакторе, скопируйте текст и вставьте в чат. Добавьте вопрос: «Кто отвечает за зал? Приведи точную цитату из текста».
Проверьте цитату по исходнику. Это уже работа с документом; устанавливать ещё одну программу для неё не требуется.
Если документов много и нужен поиск по коллекции, передайте настройщику: «Установите Open WebUI, подключите мой сервер модели, настройте локальный поиск. Передайте адрес чата, вход, название коллекции и покажите загрузку одного файла». Установка · база знаний.
На выходе: На вопрос по переданному тексту есть ответ с проверяемой цитатой. Поиск по коллекции появляется только после отдельной настройки.
Проверка: В примере шага 6 ответ — Борис; цитата — «Борис бронирует зал». Если используете коллекцию, откройте источник ответа и найдите эту строку. Пустая ссылка или выдуманная цитата — проверка не пройдена.
8. Подключите агента · по желанию
Учебная схема · вид вашей программы может отличаться
Чат уже отвечает. Доступ к папке появится на следующих шагах.Перейдите к подробным шагам А1–А4 по ссылке под картинкой.Ожидаемый итог всего маршрута — новый файл summary.md.
На входе: Чат из шага 6 работает. Пробную папку вы скачаете в А2.
Действие: Пройдите учебный маршрут OpenCode в А1–А3 и А4 ниже. Скачайте готовую папку, подключите уже работающую модель и получите файл summary.md. Для первого раза выбирать оболочку из каталога не требуется.
На выходе: Новый файл создан, его содержание проверено; известны модель, выполненные действия и разрешённая рабочая папка.
Как соединить компоненты
Для Hermes / OpenCode настройщик выбирает совместимый API: на Mac — http://127.0.0.1:8080/v1 и имя модели local-qwen из шага 5; на NVIDIA — адрес и имя модели vLLM. Для вызова инструментов в llama-server обычно нужен --jinja и совместимый шаблон модели; документация сервера ↗. Сначала проверьте один вызов инструмента. Если не работает, проверьте совместимость связки. Альтернативный маршрут через Ollama / LM Studio описан в карточке харнеса. Для отправки сообщений и удаления оставьте подтверждение.
Проверка: Пройдите А1–А4 ниже: проверьте созданный файл и историю вызовов инструментов.
1.6. Подключите харнес и инструменты
Что появится: отдельная программа-агент, подключение к вашей модели и инструменты для работы с данными. На этом сайте вы читаете инструкцию; установка выполняется на выбранном компьютере.
Три подключения: API модели — адрес, куда харнес отправляет запрос; инструмент — программа, выполняющая действие; MCP — способ подключить к харнесу дополнительные инструменты. Ключ доступа подтверждает право обращения к сервису.
Учебный маршрут ниже: Mac + llama-server + OpenCode. Он использует уже запущенную модель и готовые файлы настройки. OpenCode выбран для одного повторяемого примера; Hermes и OpenClaw остаются альтернативами в каталоге. Не устанавливайте три оболочки одновременно. На NVIDIA или в компании настройщик заменяет адрес и имя модели в конфигурации.
Сначала пройдите А1 → А2 → А3 → А4: агент прочитает два файла и создаст третий. А5 (браузер) и А6 (навык) добавляются по желанию после успешного результата.
ВЫЗадача и проверка результата
↓ задача · ↑ результат
ХАРНЕСHermes / OpenCode / OpenClaw
↕ API модели
МОДЕЛЬllama.cpp / vLLM → Qwen
↕ вызов инструмента
ИНСТРУМЕНТЫФайлы · браузер · MCP
Модель предлагает действие → харнес проверяет разрешение → инструмент выполняет → результат возвращается модели.
Что появляется
Где находится
Как узнать, что готово
Сервер модели
Mac или ПК с GPU
Отвечает на запрос через API
Харнес
Компьютер, на котором выполняется работа
Открывается окно или терминальный диалог агента
Рабочая папка
В среде, где запущен агент
Инструмент читает тестовый файл
MCP-адаптер
Рядом с харнесом либо на доступном сервере
В харнесе появился список его инструментов
Результат
В указанной папке или системе
Вы открываете и проверяете его отдельно от чата
А1. Установите одну оболочку
Учебная схема · вид вашей программы может отличаться
Откройте отдельную вкладку Терминала. Не останавливайте модель.Скопируйте команду под картинкой и нажмите Return.Версия выводится без ошибки. Пока не начинайте диалог — сначала шаг А2.
На входе: Mac из шагов 1–6, Homebrew работает. Сервер модели остаётся в своей вкладке Терминала.
Действие:
Откройте новую вкладку Терминала (⌘ T). В ней выполните:
brew install anomalyco/tap/opencode
Дождитесь завершения и проверьте:
opencode --version
Пока не запускайте диалог: сначала подготовьте папку и настройку в А2.
На выходе: Установлена программа OpenCode для запуска из Терминала. Модель повторно скачивать не нужно.
Маршрут соответствует документации OpenCode CLI. Если OpenCode уже установлен, сначала посмотрите его версию: не заменяйте другую установленную редакцию вслепую. Для существующей установки настройщик проверяет совместимость конфигурации ниже.
Проверка: Показан номер версии. command not found означает, что оболочка ещё не готова.
Учебная схема · вид вашей программы может отличаться
В архиве — два текста и настройка. Перенесите папку AI-pilot в домашнюю папку.В новой вкладке выполните две команды по очереди. Они доступны для копирования ниже.Пробу вводите в OpenCode. Ответ и запись в сервере подтверждают соединение.
Внутри папки AI-pilot должны быть brief.txt, tasks.txt и opencode.json. Это наши учебные данные и настройки, не большая модель.
В Finder нажмите ⌘ Shift H (домашняя папка) и перенесите туда AI-pilot. Если папка с таким именем уже есть, не заменяйте её: попросите настройщика выбрать новый путь и изменить команды под него.
В свободной вкладке Терминала выполните по очереди:
cd "$HOME/AI-pilot"
opencode
В открывшийся диалог OpenCode, а не в браузер модели, введите: «Ответь одним словом: готов», нажмите Return.
На выходе: OpenCode получает ответы от той же модели. Наш opencode.json уже содержит нужные значения — вручную заполнять поля не нужно.
Поле в учебном файле
Значение
Откуда взялось
baseURL
http://127.0.0.1:8080/v1
Адрес и порт из запуска llama-server
model
local/local-qwen
Имя провайдера local + --alias local-qwen
Ключ
Не задан
Наш сервер принимает только локальное подключение без ключа
permission
Запрашивать разрешение
Перед вызовом инструмента появится запрос
limit
Контекст 8192, ответ до 2048 токенов
Согласовано с начальным запуском сервера; токены — небольшие части текста
Не путайте: строка cd меняет рабочую папку, opencode запускает агента, а просьбы на русском вводятся уже внутри агента. Чтобы выйти, введите /exit. Чтобы открыть завтра: запустите модель, затем повторите две команды выше в другой вкладке.
Для другого сервера настройщик выдаёт готовый файл с фактическим адресом и Model ID из /v1/models. Ключ передаётся отдельно через защищённое хранилище или переменную окружения. Файл из архива подходит только для нашего Mac-маршрута. При изменении файла выйдите из OpenCode и откройте его заново из той же папки.
Если выбрали Hermes вместо OpenCode
Это альтернативный маршрут с настройщиком: установка Hermes. После установки CLI откройте свободную вкладку Терминала, выполните hermes model, выберите Custom endpoint, затем OpenAI-compatible Chat Completions. Для нашего Mac укажите http://127.0.0.1:8080/v1, Model ID local-qwen; ключ не нужен, пока сервер не требует авторизации. Запуск выполняется командой hermes из выбранной рабочей папки. Файл opencode.json Hermes не читает. Проверьте ответ и один вызов чтения файла; остальные шаги настройки смотрите в инструкции провайдеров Hermes.
Проверка: В OpenCode выбран «Мой Qwen» / local-qwen; пришёл ответ. В вкладке llama-server виден новый запрос. Если предлагается оплатить облачный сервис, вернитесь к проверке папки и файла настройки.
Учебная схема · вид вашей программы может отличаться
Убедитесь, что оба учебных текста находятся рядом с настройкой.Дайте задание под картинкой. Разрешите только чтение учебных файлов.Сравните первые строки с файлами в Finder. Должен быть вызов чтения.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
Прочитай инструментом файлы brief.txt и tasks.txt из текущей папки. Напиши имена файлов и первую строку каждого. Ничего не изменяй.
На входе: OpenCode отвечает из ~/AI-pilot; в папке лежат brief.txt и tasks.txt из архива.
Действие:
Введите в OpenCode:
Прочитай инструментом файлы brief.txt и tasks.txt из текущей папки. Напиши имена файлов и первую строку каждого. Ничего не изменяй.
При запросе разрешения прочитайте имя инструмента и путь. Для чтения этих двух файлов выберите разрешить один раз (Allow once / аналогичный пункт в вашей версии). Не выдавайте доступ к другим папкам.
В Finder откройте AI-pilot, нажмите по каждому текстовому файлу и пробел для быстрого просмотра. Сравните строки.
На выходе: В истории агента виден вызов чтения, а в ответе — реальные строки двух файлов. Чтобы увидеть подробности вызовов в OpenCode, введите /details в его диалоге. Команды интерфейса.
Рабочая папка — место работы, а не техническая защита всего диска. В упражнении используются только вымышленные данные и разовые разрешения. Для реальной изоляции администратор создаёт отдельного пользователя ОС или контейнер.
Проверка: Первая строка brief.txt — Проект: Маяк.; tasks.txt — Поручения по проекту Маяк. Если модель только обещает прочитать, но вызова инструмента нет, переходите к таблице ошибок.
Учебная схема · вид вашей программы может отличаться
У агента есть два исходника. Он должен создать отдельную сводку.Вставьте задание ниже. Подтвердите создание только summary.md.Выберите summary.md и нажмите пробел. Сверьте дату, 12 участников и поручения.
Кадр 1 из 3
Команды, файлы и ссылки этого шага
Прочитай brief.txt и tasks.txt. Создай в текущей папке summary.md: дата и время встречи, участники, поручения и незакрытые вопросы. У каждого факта укажи имя исходного файла. Не изменяй исходники, ничего не отправляй.
На входе: Прочитаны brief.txt и tasks.txt; файловые инструменты работают. Браузер для этого шага не требуется.
Действие:
Введите в OpenCode:
Прочитай brief.txt и tasks.txt. Создай в текущей папке summary.md: дата и время встречи, участники, поручения и незакрытые вопросы. У каждого факта укажи имя исходного файла. Не изменяй исходники, ничего не отправляй.
Подтвердите чтение исходников и создание summary.md в AI-pilot. Откажитесь от непонятных действий и разберите их с настройщиком.
В Finder откройте домашнюю папку → AI-pilot → выберите summary.md → нажмите пробел. Если просмотр недоступен, нажмите правой кнопкой → «Открыть в программе» → TextEdit.
На выходе: На диске появился третий содержательный файл — сводка из двух источников. Ответ в чате сам по себе не считается файлом.
Если вместо вызова инструмента модель печатает его название, настройщик проверяет совместимость шаблона и парсера. В нашем запуске уже есть --jinja; это не гарантия поддержки любого инструмента любой сборкой. llama.cpp tool calling.
Проверка: В summary.md должны быть 15 октября, 11:00, 12 участников, Анна — смета до 12 октября, Борис — зал до 13 октября; бюджет ещё не согласован. Сверьте имена источников. В истории видны чтение и запись, исходники не изменились.
Учебная схема · вид вашей программы может отличаться
Подготовьте Node.js. Оба номера версий должны выводиться без ошибки.Скачайте полный файл по кнопке ниже. Замените настройку и снова откройте OpenCode.После задания агенту должен сработать браузерный инструмент, а не только появиться ответ.
Через Playwright открой https://example.com и сообщи заголовок страницы. Если браузер не установлен, предложи его установку и запроси разрешение. Больше никуда не переходи.
На входе: А4 выполнен; хотите дополнительно дать агенту браузер. Интернет включён.
Действие:
В диалоге OpenCode введите /exit. В освободившемся Терминале установите Node.js, который запускает браузерный адаптер:
brew install node
Проверьте две команды по очереди: node --version, затем npx --version. Обе должны вернуть номер версии.
Скачайте вариант настройки с браузером. Он содержит всю конфигурацию, включая модель. В Finder переименуйте его в opencode.json и замените только учебный файл в ~/AI-pilot (свою рабочую конфигурацию не заменяйте). Убедитесь, что не получилось opencode.json.txt.
В этой папке снова запустите opencode. Первый запуск скачает пакет Playwright MCP. Введите в диалог:
Через Playwright открой https://example.com и сообщи заголовок страницы. Если браузер не установлен, предложи его установку и запроси разрешение. Больше никуда не переходи.
Разрешите только установку браузера, если она нужна, и открытие указанной страницы. Если шаг установки не появился, передайте ошибку настройщику.
На выходе: К файловым инструментам добавился браузер. Он открывает внешнюю страницу по команде агента.
Это пример одного внешнего инструмента. Поиск в интернете, календарь, CRM и 1С подключаются каждый отдельно: выберите нужный сервис, его поддерживаемый адаптер и способ входа. Единого ключа «ко всем инструментам» нет. Для компании используйте Б4.
Проверка: В истории есть вызов Playwright, результат — заголовок Example Domain. Самостоятельно откройте https://example.com и сравните. Ответ без вызова браузера не подтверждает подключение.
А6. Добавляйте навыки после проверки инструментов
Учебная схема · вид вашей программы может отличаться
Скачайте навык и вторую пару исходников по ссылкам под картинкой.Создайте папку командой ниже. Поместите SKILL.md именно сюда.В новом файле должны быть данные «Севера». Повторение «Маяка» — ошибка.
В Finder нажмите ⌘ Shift G, вставьте ~/AI-pilot/.opencode/skills/meeting-summary. Перенесите туда скачанный SKILL.md с этим точным именем. Точка в .opencode означает скрытую папку; переход по пути её открывает.
Вернитесь в папку AI-pilot и снова запустите OpenCode. Попросите: «Загрузи навык meeting-summary и перечисли его требования». При запросе разрешите чтение навыка.
Скачайте вторую пару исходников, распакуйте её и перенесите brief-2.txt и tasks-2.txt в AI-pilot. Дайте задачу: «Используй meeting-summary для brief-2.txt и tasks-2.txt, сохрани summary-2.md».
На выходе: Агент прочитал сохранённую инструкцию и применил её к новым данным.
Размещение навыков в OpenCode. Навык описывает порядок; установку модели и разрешения на инструменты он не заменяет.
Проверка: В истории виден вызов загрузки навыка. В summary-2.md: проект Север, 22 октября, 14:30, 8 участников, Ирина — программа до 20 октября; место не выбрано. Если повторились данные «Маяка», результат неверен.
Если выбран OpenClaw
Установите OpenClaw, выберите провайдера модели, затем подключите инструменты и выполните пробу А4. Для vLLM используйте отдельную инструкцию провайдера; для Ollama — родной API Ollama, обычно http://127.0.0.1:11434 без /v1. Это два разных маршрута: добавлять Ollama к работающему vLLM автоматически не требуется. Браузер настраивается отдельно. Подключение Telegram — канал общения с агентом; доступ к рабочим файлам оно само по себе не создаёт.
1.7. Видео к инструкции
Начните с русскоязычного примера OpenCode, если хотите увидеть работу агента. Для запуска модели на Mac используйте первый ролик.
Смотрите нужный эпизод, возвращайтесь к карточке шага и выполняйте её проверку. Модель, адреса и команды берите из нашей инструкции; отличия каждого ролика подписаны ниже. Видео открываются на сайте автора в новой вкладке.
Что смотреть. Как выглядит запуск сервера модели на Mac и переход к браузерному интерфейсу.
Как применить у нас. В ролике llama.cpp собирают из исходников. В нашей памятке устанавливаем через Homebrew; файл Q8 и полную команду запуска берите из шагов 3–5.
Что смотреть. Как задача в чате превращается в HTML, CSS и JavaScript в рабочей папке. Смотрите отличие ответа модели от созданных файлов.
Как применить у нас. У автора Ollama и Gemma 3 27B. В учебной сборке используем llama-server, Qwen и папку AI-pilot; подключение и разрешения — по А2–А4.
Что смотреть. С 23:17 — подключение OpenCode к запущенному llama.cpp; с 26:01 — пример задачи по созданию страницы.
Как применить у нас. Ролик ориентирован на NVIDIA/CUDA, другой вариант Qwen и дополнительные настройки. Для Mac сохраняйте параметры нашей инструкции. Сложные настройки ускорения для первого запуска не нужны.
IA Local para Programar: Configura Qwen con llama.cpp y OpenCode
Подборка проверена 11.10.2026 по описаниям, главам и страницам авторов; названия подтверждены метаданными YouTube. Для перевода используйте субтитры и автоперевод, если они доступны в плеере.
2. Для компании
2.1. Базовый стек
Что понадобится
Сервер или рабочая станция с RTX PRO 6000 Blackwell на 96 ГБ видеопамяти ↗, системной памятью, быстрым SSD и сетью. Одна карта подходит как старт для пилота. Если требуется до 30 одновременных ответов, сравните в пилоте одну и две GPU или два сервера. Число карт определяют измерения и допустимое время ожидания. На личном стенде ведущего RTX 4090 с 48 ГБ обслуживала до 15 одновременных запросов к Qwen3.8-27B (исследование скорости ↗). В обсуждении на занятии прозвучала оценка до 32 параллельных потоков на двух RTX PRO 6000. Для корпоративной конфигурации её нужно проверить отдельно: число потоков само по себе не гарантирует комфортной скорости.
Что входит в «обвязку»
Сервер модели с API, привычный сотрудникам интерфейс, учётные записи и права доступа, подключение внутренних документов и систем, мониторинг нагрузки и резервное копирование. Нужен ответственный за инфраструктуру и доступы, а для рабочих сценариев — владелец со стороны бизнеса. Полезность решения появляется, когда модель встроена в конкретную задачу: например, поиск по документам, переписку с поставщиками или поддержку клиентов.
Сколько закладывать
Рабочий ориентир ведущего: 1,7–2,2 млн ₽ за одну RTX PRO 6000 + около 1 млн ₽ на общую обвязку. Тогда две карты дают 4,4–5,4 млн ₽ на запуск при одном общем комплекте обвязки. Это предварительный бюджет: состав оборудования, работы, налоги и гарантию уточняют в КП.
Как проверить до закупки
Возьмите 10–20 настоящих задач команды, измерьте качество ответов и время ожидания. Затем проверьте нагрузку при 30 одновременных запросах: время до начала ответа, скорость выдачи и очередь. Число сотрудников с доступом и число одновременно работающих людей — разные показатели. Для такой проверки подходит, например, нагрузочный тест vLLM ↗.
Маршрут внедрения:
личный пробный запуск → пилот для небольшой группы → тест на реальных документах и параллельных запросах → окончательная конфигурация компании.
Основной маршрут этой памятки
Сервер с GPU → Qwen3.8-27B-FP8 → vLLM → Open WebUI → поиск по документам и персональные права
Корпоративная инструкция использует официальные FP8-веса и vLLM. На RTX PRO 6000 с 96 ГБ поместится и BF16, но FP8 оставляет больше памяти под контекст и одновременные запросы. Одна GPU — конфигурация пилота с очередью. Две GPU — вариант для сравнения под нагрузкой.
Для первого запуска: переходите к сборке, затем к агенту. Каталоги выше нужны, если вы хотите сравнить альтернативы.
2.2. Модели и программы
Для команды из 20–30 человек разделите интерфейс и сервер моделей. Сначала проверьте одну модель на своих задачах и измерьте параллельную нагрузку.
Модель — это файл с обученными весами. Обвязка — программа, которая его запускает и даёт окно для работы. Открытые веса можно скачать, но правила использования зависят от лицензии. Наличие файла модели само по себе не даёт чат, поиск по документам или права доступа.
1. Выберите модель
Четыре понятных кандидата для старта. Это подборка для сравнения на ваших задачах, а не рейтинг всех существующих моделей. B означает миллиарды параметров, а не гигабайты памяти.
Основная модель памятки
Qwen3.8 · 27B
Текст, код, изображения и многошаговые задачи. Подходит как кандидат для домашней станции и корпоративного пилота.
Для корпоративного сервера выбран FP8. Число GPU подбирайте по одновременной нагрузке и времени ожидания.
Какой файл или команду выбрать:ollama run gpt-oss:20b
Команда выполняется в терминале после установки Ollama. Первая загрузка требует интернета; затем модель можно запускать локально.
Как понимать память. FP8 снижает точность весов до 8 бит; модель в памяти занимает больше места, чем Q4, но оставляет на 96 ГБ GPU запас под контекст и несколько запросов. Размер скачанного файла меньше общего расхода памяти: дополнительно нужны контекст, изображения и программа. Для 20–30 пользователей число одновременно работающих сессий важнее числа учётных записей; окончательную конфигурацию определяет пилот.
2. Выберите обвязку
Основной маршрут инструкции: Open WebUI + vLLM + Qwen3.8-27B-FP8. Ollama — альтернативный движок для пилота; при его выборе меняются настройки подключения и способ нагрузочного теста. Одновременно оба движка не требуются.
Общий чат и документы
Open WebUI
Веб-интерфейс для сотрудников: чаты, учётные записи, документы и поиск по ним. Подключается к Ollama или совместимому API сервера моделей.
Администратор устанавливает Open WebUI → подключает модель → создаёт пользователей → проверяет права на документы.
Своя лицензия с условиями по брендингу: см. ссылку ниже.
Откройте карточку разработчика. В Hugging Face файлы находятся на вкладке Files and versions; в Ollama используйте точное имя и размер модели.
2Совместимый формат
Для llama.cpp — GGUF. Для LM Studio — поддерживаемая сборка из поиска приложения. Для vLLM — веса и рецепт запуска из карточки модели; GGUF не универсален.
3Пробный результат
Задайте одинаковые вопросы двум моделям. Проверьте русский язык, ответы по документу и скорость. Затем отключите интернет и повторите локальный запрос.
Лицензии и источники. У Qwen и gpt-oss в этой подборке — Apache 2.0; у Gemma — собственные условия ↗. LM Studio распространяется по · условиям приложения ↗. Для Open WebUI проверьте · условия брендинга ↗. Ссылки на первоисточники приведены рядом с описаниями.
Для поиска по документам нужен отдельный компонент. Qwen3.8 пишет ответ, а embedding-модель помогает находить нужные фрагменты. Кандидат для внутреннего поиска — Qwen3-Embedding-0.6B ↗ (Apache 2.0). Настройщик запускает её внутри контура через совместимый сервис, подключает к Open WebUI и проверяет поиск на русском языке. Также нужны извлечение текста и индекс; для сканов — OCR. · Как устроен поиск в Open WebUI ↗.
2.3. Агентские оболочки
Общий сервер моделей можно использовать для разных агентов сотрудников. Рабочие папки, память и права каждого агента настраиваются отдельно.
Харнес (harness) — среда работы агента. Он передаёт задачу модели, хранит ход работы, вызывает инструменты и возвращает модели результат каждого действия. Модель выбирает следующий шаг; харнес организует его выполнение в пределах заданных прав.
МодельQwen, Gemma, gpt-ossПредлагает ответы и следующие действия
ДвижокOllama, LM Studio, vLLMЗапускает модель и принимает запросы
ХарнесOpenClaw, Hermes, OpenCode…Управляет шагами и вызовами инструментов
ИнструментыФайлы, браузер, терминал, MCPЧитают данные и выполняют действия
С чего начать
Для сотрудников с офисными задачами начните пилот с OpenClaw или Hermes. Для разработки выберите OpenCode, Cline или Aider. Выбор по задаче — рекомендация этой памятки; устанавливать всё сразу не требуется.
OpenClaw
Помощник в привычных каналах
OpenClaw
Агент на вашем компьютере или сервере. Принимает задачи через чат и мессенджеры, использует инструменты, навыки и автоматизации.
Пример задачи. Собрать сводку из разрешённой папки и подготовить черновик ответа.
С локальной моделью. Подключается к локальному Ollama через его родной API. В настройках OpenClaw нужен адрес без /v1.
С чего начать
Установка → первоначальная настройка → выбор модели → подключение одного канала.
Агент Nous Research с памятью между сессиями, повторно используемыми навыками, расписанием и подключением мессенджеров. Есть приложение и терминал.
Пример задачи. Запомнить формат сводки и использовать его при следующей подготовке отчёта.
С локальной моделью. Можно подключить LM Studio или собственный сервер Ollama / vLLM через совместимый endpoint. Hermes Agent — программа; модель выбирается отдельно.
С чего начать
Установить → выбрать провайдера командой hermes model → указать модель → открыть рабочую папку.
Читает проект, предлагает изменения, редактирует файлы и запускает команды. Доступен в терминале, приложении и интеграциях с редактором.
Пример задачи. Добавить кнопку в сайт, изменить код и проверить результат.
С локальной моделью. Поддерживает локальный Ollama и совместимые API. Для Ollama в документации OpenCode используется адрес с /v1; выбирайте модель, умеющую вызывать инструменты.
С чего начать
Установить → открыть папку проекта → подключить провайдера → выбрать модель → дать небольшую задачу.
Агент сотрудника → внутренний API → vLLM + модель на сервере компании
Обычный чат Open WebUI можно сохранить для вопросов и документов. Харнес подключается к серверу модели отдельно и получает свои инструменты. Работающий чат ещё не доказывает, что модель надёжно выполняет многошаговые задания и вызовы инструментов.
1Подключите модель
Выберите локальный или внутренний сервер в настройках провайдера. Название модели должно совпадать с установленным. Адрес и формат API берите из инструкции конкретного харнеса.
2Дайте одну задачу
Создайте отдельную рабочую область для пилотной группы, подключите внутренний сервер моделей и задайте доступ к нужным источникам. Общий сервер модели не означает общую память агентов. Проверьте разделение данных двумя тестовыми пользователями.
3Проверьте итог
Откройте созданный файл, сравните с исходниками и посмотрите выполненные действия. Для отправки сообщений, удаления и изменений во внешних системах настройте подтверждение.
Что учитывать в бюджете и настройке. Открытый код оболочки не включает стоимость облачных моделей и внешних инструментов. При локальной модели остаются расходы на оборудование и обслуживание. Для полностью внутреннего сценария проверьте также вспомогательные модели, поиск, мессенджеры и интеграции: Telegram или внешний веб-поиск обращаются во внешние сервисы. Поддержку вашей модели и нужных инструментов проверяйте в небольшом пилоте.
Официальные источники указаны рядом с описаниями. Проверено 11 октября 2026 года.
2.4. Бюджет и поставщики
Начните с измерения нагрузки. 30 учётных записей не означают 30 одновременных генераций. Один GPU — кандидат для пилота с очередью; два GPU — кандидат для более высокой нагрузки. Ни один из вариантов не имеет подтверждённой в этой оценке производительности на 30 параллельных запросах. Рабочие ноутбуки сотрудников считаем уже имеющимися.
Одна RTX PRO 6000 · пилот
2,7–3,2 млн ₽ на запуск = одна карта за 1,7–2,2 млн ₽ + 1 млн ₽ общей обвязки.
Две RTX PRO 6000 · проверка нагрузки 30 человек
4,4–5,4 млн ₽ на запуск = две карты по 1,7–2,2 млн ₽ + тот же 1 млн ₽ общей обвязки. Расчёт предполагает одну совместимую платформу, а не отдельный сервер под каждую карту. Два GPU в одном сервере не дают отказоустойчивость самого сервера.
Фото карты — из карточки MDM, сервера — из карточки Сервис 2010. Ссылки сохранены для запроса спецификации; бюджет выше — ориентир ведущего, а не текущий прайс этих магазинов. Наличие, версия карты, гарантия и налоги требуют подтверждения поставщика.
Что входит в «обвязку»
В запросе КП перечислите серверное шасси, CPU, RAM, NVMe, питание и охлаждение, сеть, ИБП, резервное копирование, установку vLLM и интерфейса, права доступа, мониторинг и нагрузочный тест. Миллион рублей — бюджетный ориентир ведущего, а не подтверждённая цена этого полного перечня. Поставщик должен показать состав и стоимость каждой позиции. Отдельно уточните версию GPU (Server или Workstation Edition), налоги, гарантию, доставку и совместимость двух карт в одном шасси. Интеграции с 1С/CRM, OCR сложных сканов, лицензии и круглосуточный SLA оцениваются отдельно.
Эксплуатация и стоимость первого года
Техническое сопровождение: резерв 30–80 тыс. ₽/месяц. Это 360–960 тыс. ₽/год на обновления, мониторинг, резервные копии и устранение сбоев. Внутренний администратор может выполнять эту работу, но его время тоже имеет стоимость. Развитие бизнес-сценариев и 24/7 SLA оцениваются отдельно.
Пример электричества: при средней нагрузке 0,8–1,5 кВт, круглосуточной работе и условном тарифе 8 ₽/кВт·ч получаем 4 608–8 640 ₽ за 30 дней. Это допущения, не измерение сервера. Охлаждение и размещение в ЦОД сюда не входят.
Для двух GPU первый год ≈ 4,82–6,46 млн ₽ = запуск 4,4–5,4 млн ₽ + сопровождение 0,36–0,96 млн ₽ + электричество 0,055–0,104 млн ₽. Налоговые поправки, охлаждение, аренда и работы вне состава «обвязки» увеличат сумму.
Что проверить в пилоте: 10–20 реальных задач → нагрузка 1 / 5 / 10 / 20 / 30 одновременных запросов → время до первого токена, скорость ответа, очередь и качество. Используйте одну и ту же модель, контекст и длину ответа. Пример инструмента — vLLM bench serve ↗. Для модели, помещающейся на одном GPU, можно проверить две реплики с распределением запросов. Объём памяти двух GPU не становится автоматически единой памятью для одного запроса.
Состав корпоративного стека
Qwen3.8-27B-FP8 + vLLM → Open WebUI → персональные учётные записи → локальная embedding-модель, извлечение текста и индекс → мониторинг и резервное копирование. Это состав шагов 1–9 инструкции. Отдельно нужны владелец инфраструктуры и владелец бизнес-сценария. Выбор ПО и проверка лицензий входят в проектирование; платные лицензии в этой оценке не заложены. OCR сложных сканов, интеграции и настройка агентов из шага 10 требуют отдельной оценки.
Для запроса поставщику: точная версия GPU и артикул, CPU/RAM/SSD, охлаждение и питание, цена с налогами и доставкой, гарантия на весь сервер, срок поставки, сборка и тест. Запросите тест вашей модели на 30 параллельных запросах с согласованным временем ожидания. Ориентир 1 млн ₽ на обвязку нужно подтвердить спецификацией и предложением на работы.
2.5. Пилот и внедрение
Сервер с GPU → Qwen3.8-27B-FP8 → vLLM → Open WebUI → поиск по документам и персональные права. Шаги 1–8 выполняются на пилотном стенде, шаг 9 — закупка или принятие окончательной конфигурации и передача команде. Агент добавляется отдельно в шаге 10.
Если вы руководитель или сотрудник: не вводите серверные команды на своём ноутбуке. В карточках ниже вы передаёте конкретное задание администратору, получаете адрес / файл / протокол и сами проверяете результат. Если администратора пока нет, начните с выбора исполнителя; готовый сервер не настраивает себя.
Если вы администратор: используйте официальные инструкции vLLM и Open WebUI для выбранной ОС, сети и способа установки. Эта памятка задаёт последовательность и приёмку; конкретные команды вашей инфраструктуры фиксируются в паспорте системы. Сотрудник должен получить уже заполненные адреса, а не шаблоны.
9 основных шагов и один дополнительный шаг с агентом для 20–30 человек.
Подготовьте комплект
Сервер в сборе + ИБП + место с охлаждением + внутренняя сеть
Также нужны: рабочие компьютеры сотрудников, модель и интерфейс, разрешённые документы, администратор и владелец задачи.
1. Выберите первую задачу
Учебная схема · вид вашей программы может отличаться
Откройте привычную таблицу. Добавьте три колонки и критерий времени.Скопируйте учебный пример. Затем добавьте свои задания и правильные факты.Попросите коллегу проверить одну строку без ваших объяснений.
На входе: Владелец процесса и два сотрудника, выполняющие похожую работу.
Действие:
Создайте обычную таблицу «Пилот ИИ» в Excel или другом привычном редакторе. Колонки: № / входной файл / задание / правильные факты / допустимое время / результат пробы.
Для первой строки возьмите brief.txt: задание «Когда встреча и сколько участников?»; факты — 15 октября, 11:00, 12 участников. Допустимое время согласуйте с сотрудниками; например, 30 секунд — только пример критерия, не обещание скорости.
Добавьте 10–20 своих разрешённых примеров с ответами, которые сотрудник умеет проверить. Передайте таблицу администратору.
На выходе: Есть таблица с понятным входом и эталоном для каждого задания.
Проверка: Другой сотрудник может проверить ответ по таблице без объяснений автора. Укажите число людей, которые могут запускать задачу одновременно: 30 учётных записей и 30 одновременных запросов — разные нагрузки.
2. Получите пилотный стенд
Учебная схема · вид вашей программы может отличаться
Передайте поставщику таблицу задач и запрос из подробностей.Согласуйте стенд, даты и ответственного. Это заявка, а не экран конкретного магазина.Нужен выделенный стенд с проверенным входом, не ссылка на каталог.
Кто делает: Администратор и закупщик; руководитель принимает результат.
Полная инструкция и помощь
На входе: Таблица задач и администратор, отвечающий за установку.
Действие:
Выберите из раздела бюджета поставщика или используйте имеющееся оборудование. Передайте ему таблицу задач и текст запроса ниже.
Получите условия теста: даты, конфигурацию, стоимость, куда разрешено загружать данные, кто устанавливает ПО и кто устраняет ошибки.
Администратор проверяет вход на стенд; вам передаёт заполненную спецификацию и срок готовности чата.
На выходе: Выделен реальный стенд для проб, назначен исполнитель.
Текст запроса поставщику: «Нужен пилот локального ИИ для 20–30 сотрудников. Проверьте Qwen3.8-27B-FP8 через vLLM на приложенных заданиях. Укажите точную конфигурацию и стоимость теста. Предоставьте протокол качества, времени и ошибок при 1, 5, 10, 20 и 30 запросах. Отдельно укажите стоимость оборудования, установки, поддержки, налоги и доставку. Закупку согласуем после проверки».
Секретные рабочие данные на внешний стенд передавайте только по согласованным условиям; учебные файлы памятки вымышленные.
Проверка: В спецификации есть модель и число GPU, видеопамять, RAM, SSD и срок доступа. Ссылка на каталог оборудования без выделенного стенда не считается результатом.
3. Подключите сервер
Учебная схема · вид вашей программы может отличаться
Физическое подключение выполняет инженер по спецификации.Для аренды инженер настраивает защищённое подключение вместо физических кабелей.Сотрудник получает конкретный способ входа. Один индикатор питания не доказывает связь.
Кадр 1 из 3
Кто делает: Инженер; сотрудник получает условия подключения.
Полная инструкция и помощь
На входе: Стенд выделен; известны размещение и ответственный инженер.
Действие:
Для своего сервера инженер подключает питание через подходящий ИБП, внутреннюю сеть и охлаждение по спецификации. Для арендованного — проверяет согласованный защищённый доступ.
Попросите передать короткую запись: где стоит сервер / из какой сети доступен / нужен ли VPN / кто включает / кому звонить.
С рабочего места пилотного сотрудника инженер проверяет связь. Если нужен VPN, он устанавливает клиент и показывает вход.
На выходе: Сервер доступен из той сети, где будут работать сотрудники.
Проверка: Инженер демонстрирует подключение с рабочего компьютера сотрудника. Сам по себе включённый индикатор питания не доказывает доступность. Конкретные кабели и электрические подключения выбирает специалист.
4. Проверьте оборудование
Учебная схема · вид вашей программы может отличаться
Откройте согласованную спецификацию.Попросите аппаратный тест и сопоставление с заказом.Переходите дальше после совпадения спецификации и фактических результатов.
Кадр 1 из 3
Кто делает: Инженер; закупщик сверяет акт.
Полная инструкция и помощь
На входе: Сервер подключён; спецификация сохранена.
Действие:
Передайте инженеру спецификацию из шага 2. Попросите аппаратный тест и снимок фактических GPU и памяти.
Инженер проверяет драйвер, ошибки GPU, память, диски, питание и температуру под тестовой нагрузкой. Длительность и метод указывает в протоколе.
Сверьте таблицу «заказано / установлено / проверено». При расхождении верните поставщику на уточнение до запуска пилота.
На выходе: Есть подписанный исполнителем протокол и фактическая конфигурация.
Проверка: Число GPU и объём памяти совпадают со спецификацией; ошибки и перегрев разобраны. Запись «всё нормально» без результатов теста недостаточна.
5. Запустите внутренний чат
Учебная схема · вид вашей программы может отличаться
Получите заполненную карточку. Адрес /v1 предназначен для программ, а не для чата.Откройте URL чата, войдите, выберите модель. Вставьте текст и вопрос о встрече.Ответ сверяется с brief.txt, запрос — с журналом сервера.
Кто делает: Администратор устанавливает; сотрудник входит и проверяет.
Полная инструкция и помощь
На входе: Оборудование проверено, назначены администратор и два пилотных пользователя.
Действие:
Передайте администратору: «Разверните Qwen3.8-27B-FP8 через vLLM, установите Open WebUI и подключите его к модели. Создайте два персональных входа. Выдайте мне адрес страницы чата, способ входа и название модели в списке».
Получите заполненные значения. На рабочем компьютере откройте браузер, вставьте адрес чата в адресную строку и войдите своей учётной записью.
Создайте New Chat / Новый чат, в выборе модели укажите имя, выданное администратором. Вставьте текст brief.txt и вопрос: «Когда встреча и сколько участников?». Нажмите отправку.
На выходе: Вы переписываетесь с корпоративной моделью в браузере. Сотруднику не нужен собственный GPU.
Администратору: где соединяются Open WebUI и модель
В Open WebUI откройте Settings → Admin → Connections, добавьте OpenAI-compatible соединение с действительным адресом API vLLM и ключом, если он настроен. Проверьте список моделей и сохраните. Официальная инструкция соединения. В контейнере 127.0.0.1 указывает на этот контейнер; адрес vLLM должен быть доступен именно из Open WebUI. Первая страница сотрудника — URL Open WebUI, не URL vLLM. Назначьте пользователей и права до выдачи доступа.
Проверка: Ответ: 15 октября, 11:00, 12 участников. Администратор находит этот запрос в журнале vLLM. Если вы видите JSON или ошибку /v1, вам передали адрес API вместо адреса чата.
Учебная схема · вид вашей программы может отличаться
Откройте Knowledge. Если пункта нет, администратор должен выдать права.Загрузите файл, затем прикрепите коллекцию в чате через #.Откройте источник. Другой отдел проверяется отдельной учётной записью.
Кто делает: Администратор настраивает поиск и права; сотрудники проверяют.
Полная инструкция и помощь
На входе: Чат работает; есть два тестовых пользователя с разными правами.
Действие:
Попросите администратора настроить локальные обработку документов и поиск, выдать право создавать учебную коллекцию. Подготовьте brief.txt и отдельный вымышленный файл для другого отдела, например с фразой «Код учебного отдела Б: СИНИЦА-42».
В Open WebUI откройте Workspace / Рабочая область → Knowledge / Знания → Create / Создать. Назовите коллекцию «Пилот — отдел А», загрузите brief.txt и дождитесь окончания обработки. Если этих пунктов нет, администратор должен выдать права или создать коллекцию сам.
В новом чате напечатайте #, выберите эту коллекцию и спросите: «Сколько участников встречи? Приведи цитату и источник».
Откройте ссылку на источник ответа. Затем с администратором повторите проверку из учётной записи другого отдела, которой эта коллекция не разрешена.
На выходе: Разрешённый документ находится, источник открывается; чужая коллекция не раскрывается.
Инструкция Knowledge. Индекс — подготовленная база для поиска по загруженным текстам; он не возникает от установки модели. Для сканов сначала нужно распознавание. Если поиск не работает, проверяйте извлечение текста, обработку, выбранную коллекцию и режим поиска.
Проверка: В разрешённом ответе — 12 участников и строка brief.txt. Ограниченная учётная запись не видит документ и не получает его текст. Администратор проверяет отказ также на уровне поиска, до передачи фрагмента модели.
Учебная схема · вид вашей программы может отличаться
Администратор сохраняет данные и настройки пилота.Восстановите копию отдельно от рабочего сервера и получите адрес тестового чата.Проверьте и документ, и запрет доступа. Один архив ещё не подтверждает восстановление.
Кадр 1 из 3
Кто делает: Администратор; владелец задачи проверяет восстановленное.
Полная инструкция и помощь
На входе: Есть настроенный чат, коллекция «Пилот — отдел А» и тестовые учётные записи.
Действие:
Попросите администратора сохранить настройки, пользователей, документы и нужные данные поиска на отдельное хранилище, затем восстановить их в отдельную тестовую среду.
Получите адрес восстановленного чата и время, на которое сделана копия. Не заменяйте рабочий сервер ради проверки.
Войдите, откройте учебную коллекцию, задайте вопрос про 12 участников. Повторите проверку запрещённого доступа.
На выходе: Резервная копия доказала пригодность; записаны ответственный, расписание и время восстановления.
Проверка: В восстановленной среде открывается исходный документ и сохраняются права. Наличие файла архива без пробного восстановления не завершает шаг.
8. Проверьте работу под нагрузкой
Учебная схема · вид вашей программы может отличаться
Передайте инженеру прежние задания: сравнивать нужно одинаковые условия.Инженер выполняет серии. В таблице должны быть замеры, а не обещания.Примите число одновременных задач по протоколу; 30 сотрудников — не обязательно 30 запросов.
Кадр 1 из 3
Кто делает: Администратор измеряет; сотрудники сверяют качество.
Полная инструкция и помощь
На входе: Работающий пилот и таблица критериев из шага 1.
Действие:
Передайте администратору те же задания из таблицы «Пилот ИИ». Он запускает серии на 1, 5, 10, 20 и 30 одновременных запросов.
Попросите таблицу: параллельные запросы / время до первого текста / время до полного ответа / ошибки / доля правильных ответов / длина входа и ответа. Для каждой серии запишите параметры модели.
Сравните каждую строку с согласованными пределами. Если 30 запросов не проходят, уменьшайте одновременную нагрузку или испытывайте другую конфигурацию.
На выходе: Вы знаете измеренную вместимость именно своего стенда, а не число из рекламы.
Проверка: Протокол содержит реальные значения и примеры ответов; есть явно принятое число одновременных задач. Для агентов замер повторяется в Б6: одна задача агента вызывает модель несколько раз.
9. Передайте систему команде
Учебная схема · вид вашей программы может отличаться
Попросите администратора заполнить паспорт системы реальными значениями.Передайте инструкцию человеку, который не участвовал в настройке.Если адрес пришлось объяснять устно, дополните паспорт перед передачей команде.
Кадр 1 из 3
Кто делает: Владелец задачи и администратор.
Полная инструкция и помощь
На входе: Проверены чат, документы, права, восстановление и нагрузка.
Действие:
По протоколу утвердите конфигурацию и закупку, если она нужна. На окончательном сервере повторите шаги 4–8.
Попросите администратора заполнить паспорт ниже и дать сотруднику короткую инструкцию входа с реальными адресами.
Новый сотрудник, не участвовавший в настройке, выполняет тест шага 5, затем шага 6. После этого подключайте остальных в пределах измеренной нагрузки.
На выходе: У команды есть работающая система, адреса, понятные действия и поддержка.
Паспорт системы — заполнить после установки
Поле
Что записать администратору
Чат
Полный URL страницы для браузера; название модели в списке
Вход и сеть
Как получить личный вход; нужен ли VPN
Модель для агента
Base URL, Model ID, способ получения персонального ключа; сам секрет сюда не вписывать
Агент
Название и версия, где открыть, рабочая папка
Документы
Название доступной коллекции, ответственный за обновление
Инструмент
Что подключено, имя инструмента, кто выдаёт доступ
Проверки
Где лежит таблица пилота и протокол восстановления
Поддержка
Контакт, часы работы, что приложить к обращению
Запуск после перезагрузки
Кто проверяет доступность и как её восстановить
Это бланк, а не готовые настройки. Пока поля пустые, сотруднику систему не передают.
Проверка: Новый сотрудник сам входит, находит учебный документ и знает контакт поддержки. Если ему приходится узнавать адреса устно, паспорт ещё не заполнен.
Продолжение: агент выполняет действия
10. Добавьте агента к одному сценарию · по желанию
Учебная схема · вид вашей программы может отличаться
Чат — исходная готовность для следующего маршрута.Откройте подробную сборку корпоративного агента по ссылке ниже.Итог — файл с проверенными данными и журнал действий.
На входе: Работающий внутренний API модели и согласованный сценарий автоматизации.
Действие: Разверните один выбранный харнес для пилотного пользователя, подключите внутренний API модели и выделенную рабочую область.
На выходе: Агент выполняет согласованную задачу, сохраняет результат и не получает доступ к чужой рабочей области.
Как соединить компоненты
Администратор задаёт внутренний адрес API, модель, индивидуальные права, журнал действий и лимиты. Память агента и доступы к инструментам проверяются отдельно от прав Open WebUI. Повторите нагрузочный тест с агентскими задачами: одна задача может вызывать модель много раз. Настройка харнеса и интеграций оценивается отдельно от базового чата.
Проверка: Пройдите Б1–Б6: проверяются инструменты, результат и разделение пользователей.
2.6. Подключите агентов сотрудников
Это продолжение шага 10: шесть конкретных операций для администратора и владельца задачи. Для пилота выберите один харнес и двух тестовых пользователей. Здесь показан вариант с отдельными рабочими средами агентов внутри компании.
ОБЩИЙ API МОДЕЛИВнутренний шлюз → vLLM → Qwen FP8
↕ API модели
СОТРУДНИК АХарнес в рабочей среде А
↕ инструменты с правами А
ПАПКА И СИСТЕМЫ АРазрешённые файлы и записи
↕ API модели
СОТРУДНИК БХарнес в рабочей среде Б
↕ инструменты с правами Б
ПАПКА И СИСТЕМЫ БРазрешённые файлы и записи
Open WebUI — отдельный клиент общего API модели. Права и документы чата не передаются агентам автоматически.
Что создаётся
Где
Кто отвечает
Общая модель и API
Сервер с GPU
Администратор инфраструктуры
Шлюз с авторизацией и журналом
Перед API модели во внутренней сети
Администратор инфраструктуры
Рабочая среда каждого агента
Рабочее место или выделенная среда сервера
Администратор
Доступ к документам и бизнес-системам
В инструментах и самих системах
Владелец данных и администратор
Итог работы
Согласованная папка или система
Владелец задачи
Б1. Создайте рабочую среду агента
Учебная схема · вид вашей программы может отличаться
Администратор устанавливает агент и выдаёт точную инструкцию открытия.Проверяйте вымышленный тестовый файл, а не чужой рабочий документ.Отказ должен быть в результате инструмента, а не только в словах модели.
Кто делает: Администратор; сотрудники выполняют пробу.
Полная инструкция и помощь
На входе: Внутренний чат прошёл пилот. Назначены два пользователя агента.
Действие:
Передайте администратору: «Установите один харнес — для этого примера OpenCode. Дайте каждому пилотному пользователю отдельную среду, рабочую папку и способ её открыть. В каждую положите учебные brief.txt и tasks.txt. Настройте разовые подтверждения инструментов».
Получите индивидуальную инструкцию: ярлык или точные действия входа на сервер, путь рабочей папки и команда запуска. Если установка на Windows, администратор использует инструкцию OpenCode для Windows; команды Homebrew с Mac туда не переносятся.
Администратор создаёт в среде А вымышленный файл only-a.txt, разрешённый только А. Из среды Б проверяет чтение этого файла через инструмент.
На выходе: У каждого есть понятный вход в свою среду; данные, история и секреты разделены.
Проверка: Оба пользователя могут открыть свою папку. Чтение only-a.txt из среды Б даёт отказ на уровне системы; одной фразы агента «не могу» недостаточно.
Б2. Выдайте карточку подключения модели
Учебная схема · вид вашей программы может отличаться
Попросите три значения. Секрет не вписывайте в общую памятку.Администратор кладёт готовую настройку в рабочую папку.Проверьте ответ из обеих сред; администратор различает запросы двух людей.
Кто делает: Администратор заполняет конфигурацию; сотрудник проверяет.
Полная инструкция и помощь
На входе: Две отдельные среды агента; сервер vLLM работает.
Действие:
Попросите администратора заполнить карточку ниже фактическими значениями и установить настройки в харнес. Для OpenCode это файл opencode.json в рабочей папке по структуре А2, с корпоративными адресом, именем и авторизацией.
Администратор проверяет доступ из самой среды агента, персональную авторизацию и журналирование. Если защищённого шлюза ещё нет, его развёртывание выполняется до выдачи доступа.
Откройте агент по выданной инструкции и напишите: «Ответь одним словом: готов». Повторите под второй учётной записью.
На выходе: Оба агента отвечают через корпоративную модель; администратор различает их запросы в журнале.
Поле
Кто и откуда получает
Base URL
Администратор выдаёт HTTPS-адрес внутреннего API; адрес должен быть доступен из среды агента
Model ID
Администратор берёт поле id из ответа этого API на /models
Авторизация
Администратор выдаёт каждому персональный доступ через принятый в компании способ
Открыть агента
Полный путь к ярлыку или точная команда на конкретной машине
Пароль входа в чат и API-ключ — разные вещи. 127.0.0.1 в учебном файле относится к машине агента, а не к корпоративному серверу.
Проверка: Вы видите ответ; администратор показывает две записи с разными пользователями. URL чата Open WebUI нельзя просто подставить вместо URL vLLM.
Учебная схема · вид вашей программы может отличаться
Поиск Open WebUI не переносится в агент автоматически. Нужно отдельное соединение.Проверьте, что агент действительно вызвал поиск.Откройте найденный фрагмент. Администратор повторяет тест без права доступа.
Кадр 1 из 3
Кто делает: Администратор соединяет; сотрудник проверяет.
Полная инструкция и помощь
На входе: Агенты отвечают через корпоративную модель; папки разделены.
Действие:
В агенте попросите прочитать brief.txt и tasks.txt, как в А3. Проверьте первые строки. Это проверка файлового инструмента.
Для поиска по коллекции передайте администратору: «Подключите поиск к этой среде агента с правами моего пользователя. Выдайте точное имя инструмента, название коллекции и один проверочный запрос».
Спросите агенту: «Используй подключённый поиск: сколько участников в учебном проекте Маяк? Дай цитату и источник». Откройте результат вызова инструмента и исходный документ.
Администратор повторяет тот же поиск с учётной записью, которой коллекция запрещена.
На выходе: Файлы доступны через чтение; коллекция — через отдельно подключённый поиск.
Коллекция Open WebUI не появляется в OpenCode автоматически. Если готового соединения нет, администратор должен подобрать или разработать адаптер. До этого можно завершить файловое упражнение; отметку «поиск подключён» не ставьте.
Проверка: Разрешённый поиск возвращает 12 участников и ссылку на brief.txt. Запрещённый не возвращает текст этого файла. Права проверяются до передачи результата модели.
Б4. Подключите одну бизнес-систему
Учебная схема · вид вашей программы может отличаться
Владелец CRM создаёт запись в тестовой среде и передаёт её ID.Администратор устанавливает подходящий адаптер. Универсальной кнопки для всех CRM нет.Результат вызова должен совпасть с реальной учебной записью.
Кто делает: Администратор интеграции вместе с владельцем системы.
Полная инструкция и помощь
На входе: Выбрана конкретная система, например ваша CRM; её администратор согласовал учебную запись.
Действие:
Попросите владельца CRM создать в тестовой среде запись «Пилот ИИ — Маяк» с согласованным ID и полем «Статус: Новый». Сохраните ID и снимок исходных полей.
Передайте заявку: «Подключите чтение этой записи из агента. Укажите систему и версию, официальный источник адаптера, способ запуска или URL MCP, способ входа, точное имя инструмента чтения и разрешённые данные».
Администратор устанавливает адаптер, вводит его команду или URL в настройку MCP выбранного харнеса, настраивает вход и проверяет появление инструментов. Он записывает для сотрудника название инструмента и действие открытия его результата.
В агенте попросите прочитать согласованную запись по её ID. Сверьте поля с самой CRM. Повторите из учётной записи без права чтения.
На выходе: Один реальный инструмент читает одну разрешённую запись.
Почему здесь нет одной универсальной кнопки: 1С, разные CRM и календари используют разные подключения. Если исполнитель не может назвать подходящий адаптер, сначала нужны его выбор или разработка, срок и оценка стоимости. До этого шага инструмент ещё не установлен. Адрес MCP относится к инструменту; /v1 относится к модели. Подключение MCP в OpenCode.
Проверка: В истории есть вызов инструмента, возвращены «Пилот ИИ — Маяк» и «Новый». Ограниченная учётная запись получает отказ. Сам ответ модели без обращения к CRM не доказывает интеграцию.
Б5. Настройте подтверждение изменений
Учебная схема · вид вашей программы может отличаться
Сохраните исходный статус перед пробой.Испытайте оба решения: сначала отказ, потом разрешение. Вид окна зависит от харнеса.Если после отмены данные изменились, настройка не прошла проверку.
Кадр 1 из 3
Кто делает: Администратор настраивает; сотрудник подтверждает или отменяет.
Полная инструкция и помощь
На входе: Чтение учебной записи работает. Администратор разрешил тест записи в тестовой системе.
Действие:
Попросите администратора включить подтверждение операций записи в харнесе и ограничить доступ на стороне CRM. Он должен показать, где видно планируемое изменение и где нажать «Отмена» и «Разрешить» в установленной версии.
Дайте агенту задачу: «Подготовь смену статуса учебной записи с Новый на Проверен. Запроси моё подтверждение перед записью». Когда появится запрос, выберите отменить / отклонить. Откройте CRM: статус должен остаться «Новый».
Повторите и разрешите только это изменение учебной записи. Обновите карточку в CRM и сверьте журнал. Если запрос подтверждения не появился, остановите пробу и верните настройку администратору.
На выходе: Вы управляете записью в систему; отмена и подтверждение имеют проверенный эффект.
Проверка: После отмены — «Новый»; после разрешения — «Проверен». Журнал содержит пользователя и изменение. Фраза «спроси разрешение» в тексте задания без технических настроек не заменяет контроль.
Б6. Примите весь маршрут
Учебная схема · вид вашей программы может отличаться
Используйте проверенные документ и ID записи из Б4.Вставьте полное задание под картинкой. Разрешите только нужные чтения и файл.Сверьте файл с документом и CRM. Журнал должен подтвердить отсутствие отправки.
Кадр 1 из 3
Кто делает: Новый пилотный сотрудник; администратор наблюдает журнал.
Полная инструкция и помощь
На входе: Работают модель, файлы, поиск и чтение CRM. Проверены права и подтверждения.
Действие:
В агенте дайте задачу: «Найди разрешённый brief.txt о Маяке и учебную запись CRM по нашему тестовому ID. Сохрани pilot-result.md: дату и время встречи, число участников, название и текущий статус записи. Укажи источники. Ничего не изменяй в CRM и не отправляй». Вставьте фактический ID из Б4.
Откройте pilot-result.md в рабочей папке независимо от диалога агента. Сверьте с документом и CRM.
Администратор показывает цепочку вызовов: поиск / чтение → чтение CRM → создание файла. Он проверяет отсутствие записи или отправки и повторяет тест прав.
Повторите нагрузочные серии шага 8 с этой агентской задачей, записав время всей задачи и число обращений к модели.
На выходе: Получен файл, в котором объединены проверенные данные документа и CRM. Есть измеренная вместимость агентского сценария.
Проверка: В файле: 15 октября, 11:00, 12 участников, Пилот ИИ — Маяк, Проверен (если успешно выполнен Б5). Источники открываются, в CRM изменений от этой задачи нет. При провале любого пункта вернитесь к соответствующему подключению; общий статус «готово» ещё не ставьте.
2.7. Видео к инструкции
Сотруднику — первый ролик про окно чата. Администратору — видео про vLLM и API.
Смотрите нужный эпизод, возвращайтесь к карточке шага и выполняйте её проверку. Модель, адреса и команды берите из нашей инструкции; отличия каждого ролика подписаны ниже. Видео открываются на сайте автора в новой вкладке.
Что смотреть. Обзор интерфейса как дополнительная ориентация перед работой с документами. Ролик включён в видеогалерею документации Open WebUI.
Как применить у нас. Показаны Llama 3 и Ollama, интерфейс может отличаться. Коллекцию, права отделов и проверку источников настраивайте по шагу 6. Поиск внутри чата подключается к агенту отдельно, по Б3.
Что смотреть. С 06:23 — запуск vLLM Serve; с 07:54 — обращение через совместимый API; с 08:54 — тестовый запрос.
Как применить у нас. Это демонстрация запуска и соединения машин. Для компании отдельно нужны персональный доступ, изоляция, резервная копия и замер нагрузки по нашей инструкции. Модель здесь выбирает администратор: Qwen3.8-27B-FP8.
Подборка проверена 11.10.2026 по описаниям, главам и страницам авторов; названия подтверждены метаданными YouTube. Для перевода используйте субтитры и автоперевод, если они доступны в плеере.
3. Как проверить результат
Работающий чат подтверждает базовый запуск. Поиск принимайте по проверенным источникам и правам доступа, агента — по выполненной задаче, корпоративную мощность — по измеренной нагрузке на реальных запросах.
Если что-то не получилось
Что вы видите
Что проверить и сделать
Как понять, что исправлено
command not found
Команда введена в Терминал? Завершена установка? Для brew выполнены её Next steps? Откройте новую вкладку и повторите проверку версии
Появился номер версии
«Файл не найден», No such file
Откройте Finder → ⌘ Shift G → ~/Models. Сверьте точное имя GGUF; оно не должно иметь (1) или временное расширение
Файл есть по пути из команды; сервер его загружает
Страница чата не открывается / connection refused
На том же ли компьютере открыт браузер? Работает ли вкладка llama-server? Посмотрите её последнюю ошибку; повторите запуск только после устранения причины
Открывается чат по адресу без /v1
На странице JSON, 404 или Not Found
Не перепутаны ли адрес чата и адрес API? Для личного Mac чат — http://127.0.0.1:8080; корпоративный адрес выдаёт администратор
Видно поле ввода сообщения
address already in use
Порт уже занят. Сначала проверьте, не работает ли чат; не запускайте вторую копию. Если порт занят другой программой, настройщик согласует новый порт во всех настройках
Одна работающая копия сервера и согласованный адрес
out of memory, программа закрылась
Закройте лишние приложения, используйте короткий тест с контекстом 8192. Передайте настройщику объём памяти, файл модели и ошибку
Сервер устойчиво отвечает на короткий запрос; при нехватке подбирается меньшая модель
В агенте 401 / 403
401 обычно указывает на авторизацию, 403 — на запрет доступа. Администратор проверяет персональный ключ и права; не копируйте секреты в обращение
Тестовый запрос разрешённому пользователю проходит
context length exceeded / слишком длинный запрос
Начните новый диалог командой /new и повторите короткий тест. Если даже он не помещается, настройщик согласует размер контекста в llama-server и limit.context в opencode.json с доступной памятью
Короткая задача выполняется без переполнения; длинные файлы пока не добавляются
Агент предлагает облачную модель
Проверьте запуск из AI-pilot и наличие именно opencode.json. Перезапустите из этой папки; сравните имя модели
Запрос виден в локальном сервере
Агент пишет «сохранил», файла нет
Раскройте вызов инструмента: была ли запись и разрешили ли вы её? Если вызова нет, настройщик проверяет tool calling
Файл открывается в Finder / файловом менеджере
MCP не запустился
Для браузерного примера проверьте версии node и npx, доступ к загрузке пакета и сообщение MCP. Если нужен браузер — завершите его установку
В истории есть реальный вызов Playwright
Документ есть, ответа по нему нет
Выбрана ли коллекция, завершена ли обработка, есть ли читаемый текст и право доступа? Передайте администратору имя файла и запрос
Появились верная цитата и открываемый источник
После перезагрузки всё исчезло
Программы нужно снова запустить: сначала модель, потом агент из своей папки. Для компании используйте паспорт системы
Те же файлы сохранились; чат и агент снова отвечают
Что отправить настройщику: номер шага, ОС, версии программ, точное действие, текст ошибки и снимок экрана без ключей и паролей. Не отмечайте шаг выполненным, пока не пройдена его проверка.
Статус инструкции: команды и поля сверены с указанной официальной документацией 11.10.2026. Учебные данные и конфигурации подготовлены для проверки. На вашем оборудовании установка модели и проба инструментов ещё должны быть выполнены; схема и готовый файл настройки не заменяют успешного запуска.