Полная стоимость ИИ-инфраструктуры показывает ежемесячные расходы на эксплуатацию production-системы, а не только счёт за обращение к модели. Модель является одной строкой TCO. Рядом с ней находятся вычисления, хранение, передача данных, оркестрация, наблюдаемость, резерв надёжности, безопасность и работа инженеров. Корректная оценка начинается с явных допущений о нагрузке, использует текущие контрактные тарифы и отдельно проверяет обычный режим, рост и сбои.
Этот материал предлагает рабочую таблицу TCO. Он не посвящён оптимизации токенов, контекста или RAG и не рассчитывает окупаемость бизнес-процесса. Задача уже: увидеть все расходы production-контура до того, как пилот станет постоянным сервисом.
Что включает полная стоимость ИИ-инфраструктуры
Сначала опишите путь запроса. Управляемая модель создаёт плату за использование. Своя модель создаёт расходы на вычислители или эквивалент стоимости оборудования, а также на питание, охлаждение, размещение, обслуживание и запас мощности. Сравнивать варианты можно только при одинаковой нагрузке и одинаковых требованиях к сервису.
Затем разберите движение данных. Входные данные читаются из хранилищ, баз, очередей или поисковых индексов. Результаты могут сохраняться для аудита или передаваться между регионами и сетями. Фиксируйте объём, операции, направление трафика, срок хранения, репликацию и резервные копии.
Добавьте контур управления: шлюзы, очереди, планировщики, кеши, секреты, системы развёртывания, логи, метрики, трассировки, оповещения и средства защиты. Надёжность требует реплик, свободной ёмкости, бэкапов и проверок восстановления. Практика построения отказоустойчивой высоконагруженной инфраструктуры помогает увидеть эти элементы как часть продукта, а не как случайные дополнения.
Отдельно считайте работу людей. Инженеры разворачивают релизы, расследуют инциденты, обновляют компоненты, проверяют поставщиков, тестируют восстановление и дежурят. Даже полностью облачная система не работает без операционной ответственности.
Как собрать рабочую таблицу production TCO
Выберите один период и одну валюту. Для иллюстрации возьмём месяц из 30 дней: 50,000 production-запросов, в среднем 4,000 входных и 800 выходных токенов на запрос, 500 GB горячего хранения, 2 TB исходящего трафика и 40 часов инженерной поддержки. Это не отраслевой ориентир. Замените каждую величину данными своего пилота.
Месячный TCO = модель или вычисления + хранение + сеть + оркестрация + наблюдаемость + резерв надёжности + безопасность + инженерная поддержка.
Для каждой строки запишите объём, единицу, действующий контрактный тариф, регион, класс сервиса, скидку, налоги и владельца. Разделите постоянные и переменные расходы. Для своего оборудования переведите закупку и ожидаемую замену в месячный эквивалент, затем добавьте размещение и эксплуатацию.
- Модель и вычисления: запросы, токены, часы ускорителей и процессоров, простаивающий резерв.
- Данные: классы хранения, операции, копии, реплики и сроки хранения.
- Сеть: трафик между зонами, регионами и во внешнюю сеть.
- Эксплуатация: оркестрация, мониторинг, логи, трассировки, защита и тесты восстановления.
- Люди: релизы, инциденты, обновления, дежурства и работа с поставщиками.
Не смешивайте расход модели с остальной системой. Если в решении есть поиск или RAG, внесите его как отдельный компонент, но не позволяйте ему подменить расчёт TCO целиком. Для всей картины важнее связать каждый ресурс с измерением нагрузки и production-требованием.
Как проверить оценку до масштабирования
Соберите три варианта одной таблицы: фактическую нагрузку пилота, ожидаемый production и стрессовый сценарий. Меняйте по одному допущению, чтобы видеть источник роста. Считайте стоимость успешного запроса, поскольку повторы, таймауты и неудачные задания тоже потребляют ресурсы.
Назначьте владельца и дату пересмотра каждой строки. Тарифы меняются, но счёт меняют и архитектурные решения. Более долгое хранение, широкая репликация, подробная телеметрия или строгие требования к восстановлению могут быть оправданы. Их стоимость должна быть видна заранее.
Команда реализовала и сопровождала высоконагруженную инфраструктуру медиаплатформы масштаба около одного миллиона пользователей в день. Этот опыт подчёркивает простой принцип: эксплуатационные расходы задаёт весь production-контур, включая обработку отказов и поддержку, а не одна цена вычислений.
Разбор аварийного восстановления серверов показывает, почему резервные копии, проверенные процедуры и инженерное время должны быть строками бюджета до инцидента. А практика FinOps для облачного бюджета помогает назначить владельцев и регулярно пересматривать ресурсы.
Перед утверждением проверьте простаивающую ёмкость, тесты восстановления, исходящий трафик, хранение телеметрии, операции безопасности и ручное реагирование. Неизвестные значения показывайте диапазоном. После пилота замените допущения фактическими метриками.
Частые вопросы
В неё входят модель или вычисления, хранение, передача данных, оркестрация, наблюдаемость, резерв надёжности, безопасность и инженерная работа по эксплуатации production-системы.
Модель обслуживает только часть запроса. Production-системе также нужны данные, сеть, развёртывание, мониторинг, восстановление, защита, запас мощности и специалисты поддержки.
Возьмите измеренный период нагрузки, перечислите объёмы и тарифы в одной валюте, разделите постоянные и переменные расходы и проверьте пилотный, рабочий и стрессовый сценарии.
Пересматривайте её при изменении нагрузки, архитектуры, тарифов, сроков хранения, требований к надёжности или поддержки и заменяйте допущения фактической телеметрией.
Если нужна независимая проверка таблицы и эксплуатационных допущений, изучите услуги ИТ-поддержки и DevOps компании МЁД.ИТ. Итоговая оценка должна связывать каждую строку расходов с измерением, владельцем и production-требованием.
