Бесплатный калькулятор для бизнеса

Сколько будет стоить ваш RAG и где можно сэкономить

Ответьте на понятные вопросы о клиентах, сотрудниках или документах. Калькулятор оценит нагрузку, покажет эффект оптимизации контекста и отдельно сравнит стоимость моделей.

  • Расчёт только в браузере
  • Без регистрации
  • Можно считать от реального счёта

01 / Калькулятор

Начните с ситуации, а не с токенов

Быстрый режим даёт оценку по бизнес-объёму. Если у вас есть трассы и точные цифры, раскройте Advanced mode ниже.

На каком вы этапе?
011. Опишите объём обычными числами
022. Выберите модели и известные расходы
033. Задайте потенциал оптимизации RAG
10%60%

Диапазон 10–60%. Сокращаются system/history/retrieval. Пользовательский запрос, ответ модели и фиксированная инфраструктура не урезаются.

Advanced mode: я знаю токены и цены

Точный расчёт по traces и invoice

Здесь сохранён инженерный режим: два сценария, prompt caching, embeddings и vector/reranker cost.

Трафик и цены
AA. Текущая система
BB. После оптимизации
Экономия / месяц$0
Экономия / год$0
МетрикаAB
Input / запрос00
Retrieval / запрос00
Cached / запрос00
LLM input / месяц$0$0
LLM output / месяц$0$0
Embeddings / месяц$0$0
Vector и reranker / месяц$0$0
Итого / месяц$0$0

Пресеты проверены 30 июля 2026 года по официальным страницам провайдеров. Регион, batch, long context, скидки и маркетплейс могут изменить ставку.

02 / Методика

Никакой магии за ползунком

Быстрый режим превращает бизнес-объём в число запросов и использует открытый token envelope. Это оценка переменных расходов, а не цена разработки проекта.

01

Бизнес-объём

volume → requests / month

Клиенты × диалоги × ответы; сотрудники × вопросы × дни; или документы × вопросы × проходы.

02

Оптимизация RAG

(system + history + retrieval) × (1 − rate)

Ползунок сокращает system, history и retrieval на 10–60%. Query и output остаются прежними.

03

Если RAG уже работает

forecast × invoice / modeled baseline

Фактический model/API-счёт нормирует модель нагрузки. Поэтому база совпадает с invoice, а не с нашей догадкой.

04

Смена модели

optimized workload × target rates + fixed infra

Тот же оптимизированный объём пересчитывается по цене выбранной модели. Фиксированный infra bill переносится без скидки.

Что не входит в быструю оценку

Разработка, observability, OCR, web search, tool calls, хранение исходных документов, налоги и разовые миграции. Точные embeddings, prompt cache и инфраструктурные изменения доступны в Advanced mode.

Частые вопросы

Откуда берутся токены, если я их не ввожу?

Из видимого допущения по глубине ответа: короткий, рабочий или глубокий. Получив traces, вы можете заменить допущение точными цифрами в Advanced mode.

Почему ползунок не уменьшает весь счёт на 60%?

Потому что оптимизируется только управляемый контекст. Output и фиксированная инфраструктура не исчезают от уменьшения top-k или истории.

Можно просто перейти на DeepSeek, GLM или Kimi?

Только после evals на ваших данных. Цена показывает экономический потенциал, но не совместимость tool calling, формат ответа, latency, безопасность или качество.

Что вводить, если текущий счёт включает несколько моделей?

Выберите основную модель и введите весь model/API-счёт как базу. Для точного разбора по маршрутам и моделям используйте Advanced mode или аудит traces.

Следующий шаг

Счёт высокий или оценка выглядит слишком грубой?

Разберём traces, retrieval, routing, prompt cache и evals. Найдём экономию, которую можно подтвердить без слепого ухудшения ответов.

    Защищено reCAPTCHA. Применяются Политика конфиденциальности и Условия использования Google.