Бесплатный калькулятор для бизнеса
Сколько будет стоить ваш RAG и где можно сэкономить
Ответьте на понятные вопросы о клиентах, сотрудниках или документах. Калькулятор оценит нагрузку, покажет эффект оптимизации контекста и отдельно сравнит стоимость моделей.
- Расчёт только в браузере
- Без регистрации
- Можно считать от реального счёта
01 / Калькулятор
Начните с ситуации, а не с токенов
Быстрый режим даёт оценку по бизнес-объёму. Если у вас есть трассы и точные цифры, раскройте Advanced mode ниже.
02 / Методика
Никакой магии за ползунком
Быстрый режим превращает бизнес-объём в число запросов и использует открытый token envelope. Это оценка переменных расходов, а не цена разработки проекта.
Бизнес-объём
volume → requests / monthКлиенты × диалоги × ответы; сотрудники × вопросы × дни; или документы × вопросы × проходы.
Оптимизация RAG
(system + history + retrieval) × (1 − rate)Ползунок сокращает system, history и retrieval на 10–60%. Query и output остаются прежними.
Если RAG уже работает
forecast × invoice / modeled baselineФактический model/API-счёт нормирует модель нагрузки. Поэтому база совпадает с invoice, а не с нашей догадкой.
Смена модели
optimized workload × target rates + fixed infraТот же оптимизированный объём пересчитывается по цене выбранной модели. Фиксированный infra bill переносится без скидки.
Что не входит в быструю оценку
Разработка, observability, OCR, web search, tool calls, хранение исходных документов, налоги и разовые миграции. Точные embeddings, prompt cache и инфраструктурные изменения доступны в Advanced mode.
Частые вопросы
Откуда берутся токены, если я их не ввожу?
Из видимого допущения по глубине ответа: короткий, рабочий или глубокий. Получив traces, вы можете заменить допущение точными цифрами в Advanced mode.
Почему ползунок не уменьшает весь счёт на 60%?
Потому что оптимизируется только управляемый контекст. Output и фиксированная инфраструктура не исчезают от уменьшения top-k или истории.
Можно просто перейти на DeepSeek, GLM или Kimi?
Только после evals на ваших данных. Цена показывает экономический потенциал, но не совместимость tool calling, формат ответа, latency, безопасность или качество.
Что вводить, если текущий счёт включает несколько моделей?
Выберите основную модель и введите весь model/API-счёт как базу. Для точного разбора по маршрутам и моделям используйте Advanced mode или аудит traces.
Следующий шаг
Счёт высокий или оценка выглядит слишком грубой?
Разберём traces, retrieval, routing, prompt cache и evals. Найдём экономию, которую можно подтвердить без слепого ухудшения ответов.