Рост расходов на ИИ: почему 42% российских компаний инвестируют в облака и инфраструктуру
По данным «Ведомостей» со ссылкой на исследование Apple Hills Digital, около 42% российских компаний планируют увеличить расходы на ИИ- и ML-решения, ещё 26% — нарастить IaaS к 2027–2028 годам. Российский рынок IaaS в 2025-м вырос на 28%, до 96 млрд рублей.

Звучит как зелёный свет на новую волну костылей в проде — и мы сейчас объясним, почему.
Прод на грани паники
Крупные облака (Cloud.ru, K2 Cloud, MWS, Selectel, T1 Cloud, VK Cloud, Yandex Cloud и прочие) дружно подтверждают: главный драйвер — ИИ-нагрузки. По данным VK Tech, 24% уже гоняют модели в облаке, ещё 22% в пилотных проектах до конца 2027-го. 40% запускают новые ИТ-продукты в облачной инфраструктуре, 34% увеличивают GPU-вычисления. На бумаге — движуха. На практике — заказ на A100/H100 и ночные пейджеры дежурному инженеру.
Реальная картина
Финдир Cloud.ru Наталия Толченникова в комментарии «Газете.Ru» режет правду-матку: основной объём IaaS — по-прежнему виртуалки, базы, Kubernetes и системы хранения. ИИ — заметная, но не основная статья расходов. И самое дорогое здесь — не обучение моделей, а их стабильная эксплуатация: инференс, хранение данных и сопутствующая инфраструктура. То есть ровно то, на чём бэкендеры обычно и сгорают.
Расходы зависят от размера бизнеса. Крупные — 10–15 млн в месяц. Средний бизнес — 400–700 тыс. Малый — 15–25 тыс. Разброс в три порядка. Малый бизнес скорее всего возьмёт подписку на API и неделю будет героически дебажить промпты. Крупный — построит выделенный кластер и через квартал обнаружит, что его никто толком не умеет эксплуатировать.
Что делать на своей стороне
Если ваш работодатель в этих 42% — готовьтесь к трём вещам.
Первое. GPU-инстансы в проде едят не только деньги, но и нервы: холодный старт, драйверы, kernel panic при нехватке VRAM. Лог выглядит примерно так:
CUDA out of memory. Tried to allocate 2.00 GiB...
RuntimeError: CUDA error: device-side assert triggeredВторое. Данные под инференс надо версионировать и держать отдельно от основной базы. Иначе через полгода вы будете гадать, на каком чекпоинте училась модель и куда делся golden dataset. DVC или хотя бы git-lfs — не костыль, а необходимость.
Третье. Мониторинг. Без отдельных метрик на latency инференса, длину очереди и token rate любой рост нагрузки превращается в алерты в три ночи и героические перезапуски по ssh.
Полезный минимум на старте:
# состояние GPU
nvidia-smi
# кто прямо сейчас жрёт VRAM
nvidia-smi pmon -c 1
# лог инференса за час
journalctl -u inference.service --since "1 hour ago"И да: бэкапы. Снова. Серьёзно. Если у вас нет оффсайт-копии чекпоинтов модели и датасетов — вы не в облаке, вы на пороховой бочке.