Запрос «своя ChatGPT» звучит на первый взгляд как каприз, но за ним обычно стоит конкретная бизнес-задача: получить помощника уровня ChatGPT или DeepSeek так, чтобы переписка, документы и коммерческая тайна компании не уходили на серверы стороннего провайдера. Технически это не копия продукта OpenAI, а развёртывание открытой модели (DeepSeek, Llama, Qwen и другие) на собственном сервере с GPU и привычным чат-интерфейсом. Разбираем, зачем это нужно бизнесу, какое железо потребуется и какой порядок затрат ждать на разных уровнях внедрения.
Зачем бизнесу локальная нейросеть, а не облачный ChatGPT
У локального развёртывания четыре практические причины, и все они бизнес-ориентированные, а не про моду на ИИ.
Приватность и коммерческая тайна. Переписка с облачным ассистентом, договоры, финансовые расчёты и код, которые сотрудники вставляют в промпт, покидают периметр компании и оседают на инфраструктуре стороннего провайдера. Для бизнеса с NDA или чувствительными данными клиентов это риск вне зависимости от политики конфиденциальности сервиса. Локальный сервер снимает вопрос: данные не покидают инфраструктуру компании.
Нет подписок и лимитов. Облачные тарифы считают по числу пользователей и объёму запросов: чем больше сотрудников подключают к ассистенту, тем выше счёт, и он растёт вместе со штатом. Свой сервер оплачивается один раз, плюс электричество и обслуживание, а число пользователей на стоимость владения почти не влияет.
Работа без интернета и без риска блокировок. Локальная модель работает в сети предприятия и не зависит от доступности внешнего сервиса, региональных ограничений или смены условий оплаты у зарубежного провайдера. Для компаний, где ИИ уже встроен в рабочие процессы, это вопрос непрерывности бизнеса, а не удобства.
Что физически нужно: сервер с GPU
Технически «своя нейросеть» — это сервер с одной или несколькими видеокартами, а не обычный офисный сервер для файлов и документов. Модель считается на GPU, и ключевой параметр здесь не частота процессора, а объём видеопамяти (VRAM): он определяет, какого размера модель поместится и с каким контекстом она сможет работать. Помимо GPU серверу нужны серверный процессор и материнская плата под несколько карт, память с запасом (от 128 ГБ и выше, желательно ECC/REG), быстрый NVMe-накопитель под модель и историю диалогов, а также питание и охлаждение под видеокарты, которые потребляют по нескольку сотен ватт каждая.
Как считать нужный объём VRAM под конкретную модель и число пользователей, подробно разобрано в статье про сервер для нейросетей и в материале как выбрать видеокарту для ИИ: для бизнеса важно, что от этого расчёта прямо зависит смета проекта.
Какую модель разворачивать: DeepSeek, Llama и другие открытые LLM
Важная оговорка: сам продукт ChatGPT от OpenAI развернуть на своём сервере нельзя, это закрытый облачный сервис. Но есть широкий класс открытых моделей сопоставимого уровня, которые можно скачать и запустить локально: DeepSeek, в том числе версии под меньший объём VRAM, Llama, Qwen и другие. Поверх такой модели ставится чат-интерфейс, похожий на привычный ChatGPT и по виду, и по опыту использования: сотрудник открывает окно чата внутри локальной сети и работает с моделью так же, как с облачным ассистентом, только без выхода данных за периметр компании.
Для экономии видеопамяти модели запускают в квантованном виде (INT8, INT4): это снижает требования к GPU в 2-4 раза почти без потери качества для большинства бизнес-задач, будь то работа с документами, поддержка клиентов или поиск по базе знаний. Чем выше нужная точность и длиннее контекст, тем больше VRAM и тем выше уровень сервера потребуется.
Три уровня внедрения: пробный, для отдела, для всей компании
Подбор сервера удобнее вести не «по бюджету», а по уровню внедрения: от пробного проекта на отдел до рабочего инструмента для всей компании. Три ориентировочных уровня — в таблице ниже, точную конфигурацию стоит считать под число пользователей и объём документов.
| Сценарий | Примерная конфигурация | Для чего |
|---|---|---|
| Тест / пилот | 1 профессиональная GPU, 24 ГБ VRAM, 64-128 ГБ ОЗУ | Проверка гипотезы на модели 7-13B: чат-помощник и поиск по документам для 5-15 сотрудников одного отдела |
| Для отдела | 1-2 GPU, 24-80 ГБ VRAM на карту, 128-256 ГБ ECC-памяти | Модель 13-34B в постоянной эксплуатации, до 30-50 одновременных пользователей, интеграция с внутренними системами |
| Для всей компании | Мульти-GPU сервер, несколько карт от 80 ГБ (A100/H100), 256 ГБ+ ECC/REG памяти | Модели от 70B и крупные MoE-архитектуры уровня DeepSeek, десятки-сотни пользователей, высокая параллельная нагрузка |
Порядок затрат: сколько стоит железо по уровням
Точную смету по телефону не назовёт никто добросовестный: цена зависит от доступности конкретных GPU, курса и конфигурации под задачу. Но порядок величин по уровням прикинуть можно.
Пробный уровень с одной профессиональной видеокартой обычно укладывается в стоимость нескольких хороших рабочих станций: самый доступный вход в тему, и с него разумно начинать, если бизнес раньше не работал с локальными нейросетями. Уровень отдела с одной-двумя картами старшего класса и увеличенным объёмом памяти обойдётся уже в несколько раз дороже пробного: это плановая инвестиция, сопоставимая с оснащением серверной под другую тяжёлую задачу вроде виртуализации или СХД.
Уровень всей компании с мульти-GPU сервером на картах класса A100/H100 и NVLink уходит в разряд крупных капитальных затрат: топовые индустриальные конфигурации для обучения крупнейших моделей могут стоить порядка нескольких десятков миллионов рублей и выше, и смета здесь всегда считается под конкретный проект. Актуальные конфигурации по каждому уровню, включая мульти-GPU серверы под DeepSeek-класс задач, собраны в разделе серверов для искусственного интеллекта.
Окупаемость против облачных API-подписок
Сравнение стоит вести не «сервер против нуля», а «сервер против подписки», потому что бесплатной альтернативы для бизнеса по сути нет. Облачные LLM-сервисы берут оплату за место пользователя и за объём обращений, и оба показателя растут вместе с командой. Год подписки для команды в 20-30 активных пользователей с учётом роста тарифов на практике нередко приближается по сумме к стоимости собственного сервера пробного уровня или уровня отдела, а дальше подписка продолжает капать ежемесячно, тогда как сервер куплен один раз.
У собственного сервера предсказуемая структура расходов: покупка, электричество, минимальное обслуживание и опциональный апгрейд GPU через несколько лет. У подписки расходы растут вместе с успехом внедрения: чем активнее сотрудники пользуются ассистентом, тем выше счёт. Для бизнеса с постоянной нагрузкой на ИИ это обычно и есть точка, где свой сервер окупается быстрее, чем кажется на старте, особенно если учитывать не только платежи за подписку, но и риск утечки данных, который она полностью не снимает.
Эксплуатация: что учитывать кроме покупки сервера
Покупка сервера не закрывает вопрос целиком, это стоит понимать до, а не после внедрения.
Электричество и охлаждение. Видеокарты уровня A100/H100 потребляют по нескольку сотен ватт каждая, и сервер с несколькими такими картами ощутимо нагружает электросеть и охлаждение серверной. Это нужно закладывать в расчёт помещения, а не только в цену железа.
Обслуживание и компетенции. Развёртывание модели, настройка чат-интерфейса и интеграция с внутренними системами (почтой, базой знаний, CRM) требуют технической компетенции: штатного специалиста либо разового проекта с подрядчиком, дальше система работает автономно.
Обновление моделей. Открытые модели вроде DeepSeek регулярно выходят в новых версиях с более качественными ответами. Сервер с запасом по VRAM позволяет заменить модель на новую без замены железа, тогда как сервер впритык быстрее упирается в потолок.
С чего начать: чеклист
- Сформулируйте задачу: что именно должен делать ассистент (поддержка клиентов, поиск по документам, помощь разработчикам) и для скольких сотрудников.
- Оцените объём и чувствительность данных, которые сейчас уходят в облачные сервисы: это и аргумент для приватности, и ориентир для выбора уровня внедрения.
- Выберите модель под задачу (DeepSeek, Llama, Qwen и другие) и определите, нужен ли полный размер весов или достаточно квантованной версии.
- Посчитайте нужный объём VRAM с запасом под контекст и рост числа пользователей, а не впритык под сегодняшний пилот.
- Подберите конфигурацию сервера (GPU, память, накопители, питание) под нужный уровень: пробный, отдел или вся компания.
- Заложите электричество, охлаждение и обслуживание в общий бюджет проекта, а не только стоимость железа.
- Начните с пилота на одном отделе, прежде чем масштабировать решение на всю компанию.
HUANANZHI — официальный дистрибьютор серверного оборудования в России, GPU-серверы для локальных нейросетей мы подбираем и тестируем перед отправкой. В каталоге — конфигурации всех трёх уровней: от одной видеокарты до мульти-GPU серверов на A100/H100 для DeepSeek-класса моделей, смотрите раздел серверов для искусственного интеллекта. Опишите задачу: число пользователей, чувствительность данных, желаемую модель, и мы подберём конфигурацию, выставим счёт и организуем доставку по России с гарантией.
Не берите сервер впритык под сегодняшний пилот: если пилот на одном отделе окажется удачным, дешевле сразу закладывать запас по VRAM и памяти на рост, чем через полгода покупать второй сервер и решать, как объединить их под общую нагрузку. Разница в цене между конфигурацией впритык и конфигурацией с запасом обычно меньше, чем стоимость повторного внедрения с нуля.
Частые ошибки
- Ждут от локальной модели буквально продукта OpenAI и разочаровываются, хотя задача решается открытой моделью сопоставимого уровня с тем же чат-интерфейсом.
- Считают бюджет только на GPU, забывая про электричество, охлаждение и обслуживание, из-за чего реальная стоимость владения оказывается выше сметы.
- Берут конфигурацию впритык под пилот на 5-10 человек и упираются в потолок VRAM, как только проект масштабируется на весь отдел или компанию.
- Сравнивают стоимость сервера с одним месяцем облачной подписки вместо нескольких лет эксплуатации, из-за чего вывод об окупаемости получается искажённым.
