Частный AI-сервер для компании в России: расчёт
Коробочный AI-сервер продают как способ выполнить 152-ФЗ. Разбираем, что закон требует на самом деле, сколько сотрудников тянет одна карта и во что это обходится в рублях.
Зачем такие серверы вообще продают в России
Частный AI-сервер для компании в России продают под одну задачу: держать модель и данные внутри страны, чтобы запрос сотрудника не уходил на зарубежный API. Задача настоящая, и штрафы за утечку персональных данных за последний год выросли в разы. Но покупка железа лишь один из способов эту задачу решить, и закон не требует именно этого способа.
Дальше считаем то, что вендорская презентация обычно пропускает: сколько людей одна такая машина обслуживает одновременно, что происходит в пиковый час и во что всё это обходится за первый и за второй год. Спор «купить готовый комплекс или развернуть всё самому» уже разобран в сравнении готового приватного AI-сервера с самостоятельным развёртыванием, повторять его здесь не буду. Здесь речь только про закупочное решение.
Что 152-ФЗ требует на самом деле
Требование о локализации записано в части 5 статьи 18 Федерального закона от 27.07.2006 № 152-ФЗ «О персональных данных». Формулировка приведена в редакции Федерального закона от 28.02.2025 № 23-ФЗ.
При сборе персональных данных, в том числе посредством информационно-телекоммуникационной сети "Интернет", запись, систематизация, накопление, хранение, уточнение (обновление, изменение), извлечение персональных данных граждан Российской Федерации с использованием баз данных, находящихся за пределами территории Российской Федерации, не допускаются, за исключением случаев, указанных в пунктах 2, 3, 4, 8 части 1 статьи 6 настоящего Федерального закона.
Прочитайте норму буквально. Она говорит о базе данных и о том, где эта база находится. Она не говорит ни слова о том, кому принадлежит сервер, какая в нём видеокарта и стоит ли он в вашей серверной. Арендованная машина в российском дата-центре выполняет это требование ровно так же, как купленная, потому что территория та же самая. Юридически это оформляется поручением обработки по части 3 статьи 6: оператор вправе поручить обработку персональных данных другому лицу на основании заключаемого с этим лицом договора. В договоре фиксируются перечень данных, перечень действий с ними, цель обработки и обязанность обработчика соблюдать конфиденциальность и требования к безопасности.
Есть вторая норма, про которую спрашивают реже. Статья 12 того же закона регулирует трансграничную передачу: оператор обязан уведомить Роскомнадзор о намерении осуществлять трансграничную передачу персональных данных до её начала. Отправка промпта в зарубежный API попадает под эту статью, если в промпте есть персональные данные. Отсюда и растёт спрос на локальные модели: проще не передавать ничего за границу, чем выстраивать процедуру вокруг каждого чата.
Требования к защите живут не в самом 152-ФЗ, а под ним. Статья 19 отсылает к подзаконным актам. Постановление Правительства РФ от 01.11.2012 № 1119 вводит четыре уровня защищённости информационных систем персональных данных (ИСПДн), а приказ ФСТЭК России от 18.02.2013 № 21 задаёт состав и содержание мер. Уровень защищённости зависит от вида данных, типа актуальных угроз и числа субъектов, и определяете его вы в своей модели угроз, а не продавец оборудования.
Цена ошибки действительно выросла. С 30 мая 2025 года работает редакция статьи 13.11 КоАП РФ, введённая Федеральным законом от 30.11.2024 № 420-ФЗ. За повторную утечку персональных данных для организаций предусмотрен оборотный штраф: от 0,1% до 3% годовой выручки, но не менее 25 млн и не более 500 млн рублей. Это и есть та цифра, которой аргументируют закупку.
Чего 152-ФЗ не требует
Этот список короче предыдущего раздела и важнее его.
- Закон не требует иметь оборудование в собственности. Аренда сервера, колокейшн и облако внутри России допустимы, если база данных физически в России и подписано поручение обработки.
- Закон не называет ни одной модели сервера, ни одного производителя GPU, ни одного «сертифицированного AI-комплекса». Такой категории в нормативных актах просто нет.
- Сертифицированные средства защиты информации нужны там, где они нужны для нейтрализации актуальных угроз. Пункт 4 приказа ФСТЭК № 21 говорит о применении в информационной системе средств защиты, прошедших в установленном порядке процедуру оценки соответствия. Какие угрозы актуальны, решает ваша модель угроз.
- Оценку эффективности принятых мер вы по пункту 6 того же приказа проводите самостоятельно или по договору с лицензиатом по технической защите конфиденциальной информации, и не реже одного раза в три года. Покупка железа эту обязанность не закрывает и не отменяет.
Если продавец говорит «наш сервер закрывает 152-ФЗ», попросите показать соответствие построчно: какой пункт какого акта закрывается какой функцией комплекса. Оборудование помогает выполнить меры. Выполняет их и отвечает за них оператор.
И ещё одно уточнение, которое меняет половину сметы. Инференс становится обработкой персональных данных только тогда, когда персональные данные есть в промптах или в корпусе для RAG (retrieval augmented generation, генерация с подмешиванием найденных документов). Чат про формулы в таблицах под 152-ФЗ не подпадает. База резюме, переписка с клиентами и медицинские документы подпадают сразу. Ответьте на этот вопрос до того, как считать деньги.
Сколько сотрудников обслуживает одна карта
Теперь арифметика. Видеопамять расходуется на две вещи: на веса модели и на KV-кэш, то есть на состояние каждого активного диалога. Веса загружаются один раз и дальше не растут. KV-кэш растёт линейно с числом одновременных сессий и с длиной контекста, и именно он упирается в потолок первым.
Размер KV-кэша считается прямо из архитектуры модели: 2 умножить на число слоёв, на число KV-голов, на размерность головы и на число байт в элементе, и всё это на каждый токен контекста. У Qwen3-32B по карточке модели 64 слоя, 64 головы для Q и 8 для KV, размерность головы 128. При хранении кэша в FP16 выходит 256 КБ на токен, то есть ровно 2 ГБ на одну сессию с контекстом 8192 токена. У Qwen3-8B слоёв 36 и KV-голов тоже 8, поэтому на сессию уходит примерно вдвое меньше.
The data behind this chart
[
{
"label": "Qwen3-8B, FP16",
"weights_gb": 16,
"kv_per_session_gb": 1.1,
"sessions_48gb": 27
},
{
"label": "Qwen3-32B, INT4",
"weights_gb": 18,
"kv_per_session_gb": 2.0,
"sessions_48gb": 14
},
{
"label": "Qwen3-32B, FP8",
"weights_gb": 33,
"kv_per_session_gb": 2.0,
"sessions_48gb": 6
},
{
"label": "Llama-3.3-70B, INT4",
"weights_gb": 40,
"kv_per_session_gb": 2.5,
"sessions_48gb": 2
}
]Столбец weights_gb это память под веса в гигабайтах, kv_per_session_gb это KV-кэш на одну сессию с контекстом 8k, sessions_48gb это сколько таких сессий остаётся на карте с 48 ГБ после весов и примерно 2 ГБ служебных расходов.
Эти числа получены арифметикой, а не замером на вашем железе. Реальная цифра будет другой: vLLM выделяет кэш блоками, кэш в FP8 уменьшает расход вдвое, а префиксное кэширование общего системного промпта возвращает часть памяти обратно. Порядок величины арифметика передаёт верно, и он неприятный. Модель на 70B в четырёхбитной квантизации оставляет на карте место всего для 2 одновременных сессий по 8k. Qwen3-32B в FP8 оставляет место для 6. Та же модель в INT4 даёт 14, но отвечает заметно хуже на длинных документах.
Какие модели вообще стоит рассматривать под русский язык и корпоративные задачи, разобрано в обзоре моделей, которые реально поднять у себя. Если вы считаете вариант без видеокарты, на обычной оперативной памяти, арифметика совсем другая и описана в расчёте, какая модель влезет в вашу оперативную память.
Что происходит в пиковый час
Главная ошибка при расчёте штата: считать, что одновременных сессий столько же, сколько сотрудников. Их меньше. Человек пишет запрос, читает ответ, уходит на совещание. Закладывайте в пиковый час от 5% до 15% от числа заведённых пользователей и обязательно проверяйте эту долю по факту, потому что она зависит от того, встроен ли ассистент в рабочий процесс или живёт отдельной вкладкой.
Даже с этой поправкой арифметика ломается. Компания на 200 человек при пике в 10% даёт 20 параллельных запросов. Карта из строки «Qwen3-32B, FP8» держит 6. Остальные встают в очередь.
Очередь ведёт себя не так, как ожидает заказчик. Пока KV-кэш не заполнен, добавление ещё одной сессии почти не влияет на скорость ответа, потому что запросы идут одним батчем. Когда кэш заполнен, сервер перестаёт брать новые запросы в батч и складывает их в очередь ожидания, а часть уже начатых может вытеснить и потом пересчитать заново. Время до первого токена прыгает с секунды до десятков секунд. Деградация не плавная, поэтому состояние «немного не хватает мощности» выглядит для пользователя как «система сломалась». Следить надо за двумя величинами в метриках инференс-сервера: заполненностью KV-кэша и длиной очереди ожидания. Как замерять это под нагрузкой, разобрано в материале про число одновременных пользователей на собственном LLM-сервере.
Два сценария ухудшают расчёт сильнее всего. Агенты: один пользователь запускает цепочку из нескольких вызовов модели, и каждый вызов занимает слот, так что один человек превращается в три или четыре сессии. RAG: к каждому запросу подклеиваются найденные фрагменты документов, контекст из 8k превращается в 32k, и KV-кэш на сессию вырастает вчетверо. Если в техническом задании есть слово «агент» или «поиск по базе знаний», делите вместимость из таблицы минимум на три.
Для многопользовательской нагрузки обычно берут vLLM, а не Ollama: он собирает запросы в общий батч и делит KV-кэш между сессиями. Разница между ними на реальной нагрузке разобрана в сравнении Ollama и vLLM.
Рубли: капекс, питание, стойка и человек
Вендорская смета обычно заканчивается на цене железа. Настоящая смета состоит из четырёх строк, и железо в ней самая предсказуемая.
Капекс. Карта на 48 ГБ класса RTX 6000 Ada в российской рознице стоит порядка 600 до 900 тысяч рублей по состоянию на сентябрь 2026 года. Это диапазон по публичным прайс-агрегаторам, а не коммерческое предложение под вашу закупку. Платформа, процессор, память и блок питания добавляют от 250 до 500 тысяч. Готовый комплекс на две карты с гарантией и пусконаладкой стоит дороже суммы компонентов, и это нормально: вы платите за сборку, тесты и ответственность поставщика.
Питание. GPU-сервер на две карты под нагрузкой потребляет около 1,5 кВт. При круглосуточной работе это примерно 13 тысяч кВт·ч в год. Подставьте свой тариф для юридических лиц: при 8 рублях за кВт·ч выходит около 105 тысяч рублей в год, и это без охлаждения. В офисной серверной кондиционирование добавляет ещё примерно половину сверху.
Стойка. Прайсы на колокейшн в Москве начинаются от 3 до 5 тысяч рублей в месяц за 1U, и в эту цену входит около 300 Вт. GPU-сервер занимает 3U или 4U и просит 1,5 кВт, поэтому в базовый тариф он не попадает ни по месту, ни по питанию. Считайте по фактическому потреблению, а не по строчке «от».
Человек. Самая дорогая строка, и в вендорской смете её обычно нет вовсе. Медиана по вакансиям DevOps-инженера в России в 2026 году держится около 218 тысяч рублей в месяц. Даже четверть его времени это больше 600 тысяч рублей в год. Кто-то должен обновлять драйверы, поднимать упавший инференс-сервер, следить за очередью и разбираться, почему на этой неделе модель отвечает медленнее, чем на прошлой.
The data behind this chart
[
{
"label": "\u041a\u043e\u0440\u043e\u0431\u043e\u0447\u043d\u044b\u0439 \u043a\u043e\u043c\u043f\u043b\u0435\u043a\u0441, 2 \u043a\u0430\u0440\u0442\u044b",
"capex_min_krub": 2000,
"capex_max_krub": 3500,
"year_min_krub": 650,
"year_max_krub": 1700
},
{
"label": "\u0421\u0432\u043e\u0439 \u0441\u0435\u0440\u0432\u0435\u0440, 1 \u043a\u0430\u0440\u0442\u0430 48 \u0413\u0411",
"capex_min_krub": 850,
"capex_max_krub": 1400,
"year_min_krub": 600,
"year_max_krub": 1600
},
{
"label": "\u0410\u0440\u0435\u043d\u0434\u0430 \u0441\u0435\u0440\u0432\u0435\u0440\u0430 \u0441 GPU \u0432 \u0420\u0424",
"capex_min_krub": 0,
"capex_max_krub": 0,
"year_min_krub": 740,
"year_max_krub": 2040
},
{
"label": "GPU \u043f\u043e \u0447\u0430\u0441\u0430\u043c \u043f\u043e\u0434 \u043f\u0430\u043a\u0435\u0442",
"capex_min_krub": 0,
"capex_max_krub": 0,
"year_min_krub": 320,
"year_max_krub": 920
}
]Столбцы capex_min_krub и capex_max_krub это единовременные вложения в тысячах рублей. Столбцы year_min_krub и year_max_krub это расходы за год эксплуатации, включая питание, площадку и долю рабочего времени администратора. Все четыре столбца содержат диапазоны, собранные из публичных прайсов и рыночных медиан на сентябрь 2026 года. Это не котировки под ваш проект, и внутри каждого диапазона ваша цифра может лежать где угодно.
Разрыв в первый год виден сразу: до 3500 тысяч рублей единовременно за коробочный комплекс против нуля при аренде. Со второго года разрыв почти исчезает: 740 тысяч при аренде против 650 тысяч у собственной коробки, и по верхней границе диапазона аренда даже дороже. Причина проста. Основная статья эксплуатации это не электричество и не стойка, а зарплата человека, и аренда сервера её не убирает. Аренда убирает капекс и риск ошибиться с конфигурацией. Строка с почасовой арендой выигрывает у всех остальных по деньгам ровно потому, что карта там простаивает не ваши деньги. Где проходит точка окупаемости между своим GPU и оплатой токенов по API, посчитано отдельно в разборе точки безубыточности GPU-сервера против оплаты токенов.
Когда коробка действительно выигрывает
- Площадка без внешней сети. Цех, объект, изолированный контур. Арендовать там нечего, и вопрос закрыт.
- Нагрузка ровная и круглосуточная. Если карта занята двадцать часов в сутки каждый день, почасовая аренда проигрывает по деньгам, а капекс размазывается за год или полтора.
- Закупочные правила требуют основного средства на балансе, а не услуги. Это не про 152-ФЗ, это про внутренний регламент и структуру бюджета, и встречается такое ограничение чаще, чем кажется.
- У вас уже есть стойка, питание и дежурный инженер. Тогда три строки из четырёх вы не платите заново, и сравнение меняется в пользу покупки.
Когда выигрывает аренда или почасовые GPU
- Вы ещё не знаете свою нагрузку. Пока нет измеренной цифры «сколько параллельных запросов в пик», покупка железа это ставка вслепую. Месяц аренды даёт эту цифру дешевле, чем любой расчёт на бумаге.
- Нагрузка неровная. Ночная переиндексация базы знаний, разовое дообучение, отчёты раз в месяц: почасовые GPU тут дешевле в разы.
- Модели меняются быстрее железа. Карта, купленная под модель на 32B, останется на балансе года на три. За это время сменится пара поколений открытых моделей, и аппетит к памяти вырастет.
- Вам нужна отказоустойчивость. Одна коробка это одна точка отказа, а второй арендованный сервер стоит заметно дешевле второй купленной карты.
Что спросить у продавца до подписания
- Какую модель и в какой квантизации вы запускали на этой конфигурации, и с каким контекстом?
- Сколько одновременных запросов держится при времени до первого токена в пределах двух секунд? Просите протокол нагрузочного теста, а не слайд с цифрой.
- Какой пункт какого нормативного акта закрывает это оборудование, и чем вы предлагаете закрывать остальное?
- Что входит в поддержку на второй и третий год, и сколько она стоит отдельной строкой?
- Где физически будет стоять машина, и кто по договору выступает лицом, обрабатывающим данные по поручению оператора?
Раскрываю интерес прямо: SSD Nodes сдаёт серверы в аренду и не продаёт аппаратные AI-комплексы. Поэтому здесь нет рекомендации конкретного поставщика ни в одну, ни в другую сторону. Решение зависит от вашей нагрузки, вашего бюджетного регламента и от того, есть ли у вас человек, который будет всё это обслуживать. Одно проверьте в любом случае: по договору выясните, где физически стоит машина, потому что требование части 5 статьи 18 привязано к территории, а не к названию поставщика.
FAQ
Обязывает ли 152-ФЗ покупать сертифицированный аппаратный AI-сервер?
Нет. Часть 5 статьи 18 закона № 152-ФЗ говорит о местонахождении базы данных, а не о собственности на оборудование, и категории «сертифицированный AI-сервер» в нормативных актах нет. Требования к защите задаются постановлением Правительства РФ № 1119 и приказом ФСТЭК России № 21. Пункт 4 приказа № 21 требует применять средства защиты, прошедшие процедуру оценки соответствия, в том объёме, в котором это нужно для нейтрализации актуальных угроз из вашей модели угроз. Определяет этот объём оператор, а не продавец оборудования.
Считается ли арендованный сервер в российском ЦОДе выполнением требования о локализации?
Да, если база данных физически находится на территории Российской Федерации. Отношения с хостером оформляются поручением обработки по части 3 статьи 6 закона № 152-ФЗ: оператор вправе поручить обработку другому лицу на основании договора. В договоре должны быть перечень передаваемых данных, перечень действий с ними, цель обработки и обязанность обработчика соблюдать конфиденциальность и требования к безопасности. Оператором и ответственным перед субъектом при этом остаётесь вы.
Сколько сотрудников обслужит одна карта на 48 ГБ?
Считайте не по числу сотрудников, а по числу одновременных сессий. После загрузки весов оставшаяся видеопамять делится на KV-кэш, и при контексте 8k это примерно 2 ГБ на сессию для модели на 32B. На практике карта с 48 ГБ держит около шести таких сессий с моделью в FP8 и около четырнадцати с моделью в INT4. В пиковый час одновременно активны примерно от 5% до 15% пользователей, поэтому шесть сессий это ориентировочно компания на 40 до 120 человек при обычном чате и заметно меньше при агентах и RAG.
Что дешевле в первый год: коробочный комплекс или аренда?
В первый год аренда дешевле, потому что капекс равен нулю, а у коробки он достигает 3500 тысяч рублей. Со второго года разница почти пропадает: годовая эксплуатация при аренде оценивается в 740 тысяч по нижней границе против 650 тысяч у собственного комплекса. Главная статья расходов в обоих случаях это зарплата человека, который систему обслуживает, и аренда её не убирает.
Нужно ли уведомлять Роскомнадзор, если модель работает внутри компании?
Уведомление об обработке персональных данных по статье 22 закона № 152-ФЗ не связано с тем, локальная у вас модель или облачная, и подаётся по общим правилам как оператором. Отдельное уведомление о намерении осуществлять трансграничную передачу по статье 12 подаётся до начала такой передачи. Локальная модель внутри России трансграничной передачи не порождает, а отправка промптов с персональными данными в зарубежный API порождает.
Порядок действий, который экономит больше всего денег, выглядит скучно: сначала определите, есть ли вообще персональные данные в промптах и в корпусе, потом месяц померяйте реальную нагрузку на арендованной карте, и только потом решайте про закупку. Смета, построенная на измеренном пике, отличается от сметы, построенной на численности штата, обычно в несколько раз.