Сколько стоит ИИ в рублях: цена за 1 млн токенов
23.09.2026 · 4 мин
Как читать прайс шлюза: цена входа и выхода, кэш-скидка, почему один и тот же запрос стоит от 10 до 3000 ₽ за миллион токенов.
Токен — единица списания
Модель не берёт денег за «запрос». Она считает токены: куски слов, из которых складывается и ваш текст, и ответ. Среднее русское слово — это 1,5–2 токена, английское — около 1,3, а код и кириллица в скобках раздуваются сильнее. Практический вывод: 1000 знаков ответа — это примерно 700 токенов, а не 1000.
Шлюз Gdevse показывает розничную цену в ₽ за 100 тыс. токенов, потому что тарифы провайдеров в долларах за токен читаются плохо. Перевод простой: ₽ за 1 млн токенов = цена за 100 тыс. × 10.
Вход и выход — разные деньги
У каждой модели две цены. Вход (prompt) — то, что вы присылаете: системный
промпт, историю диалога, файл, который попросили разобрать. Выход
(completion) — то, что модель написала. Выход всегда дороже, в среднем в
3–5 раз, потому что генерация токена стоит дороже, чем его прочтение.
Отсюда следует главный источник неожиданного расхода: не длинные ответы, а длинная история. Диалог на 50 реплик при каждом новом запросе улетает в модель целиком, и вход растёт линейно, пока вы не почистите контекст.
Разброс цен: от 10 до 3000 ₽ за миллион
Цены розничные, ₽ за 1 млн токенов, сняты со snapshot каталога 23.09.2026. Актуальные — на страницах моделей, они пересчитываются при каждой сборке каталога.
| Модель | Вход | Выход | Контекст |
|---|---|---|---|
| Meta Llama 3.3 70B | 10 ₽ | 32 ₽ | 131K |
| DeepSeek V4.1 Flash | 10 ₽ | 50 ₽ | 1,05M |
| Z.ai GLM 5.3 Flash | 15 ₽ | 50 ₽ | 1,31M |
| OpenAI GPT-5.6 Luna | 20 ₽ | 120 ₽ | 1,05M |
| Qwen3 Coder 480B | 30 ₽ | 100 ₽ | 262K |
| Anthropic Claude Sonnet 4.5 | 300 ₽ | 1500 ₽ | 1M |
| Google Gemini 2.5 Pro | 125 ₽ | 1000 ₽ | 1,05M |
| OpenAI GPT-5.5 Pro | 3000 ₽ | 18000 ₽ | 1,05M |
Между Llama и Claude Sonnet — тридцатикратная разница по входу, при том что для
половины задач заметной разницы в качестве нет. Варианты с суффиксом *-pro
стоят ещё на порядок дороже: это отдельный тариф за максимальное качество, а не
рабочая лошадка.
Что реально тратит баланс
Считаем на реальных цифрах. Чат-бот на поддержке: 800 токенов контекста и правил на входе, 250 токенов ответа, 3000 диалогов в месяц.
- вход: 800 × 3000 = 2,4 млн токенов
- выход: 250 × 3000 = 0,75 млн токенов
- DeepSeek V4.1 Flash: 2,4 × 10 + 0,75 × 50 = 61,5 ₽ в месяц
- Claude Sonnet 4.5: 2,4 × 300 + 0,75 × 1500 = 1845 ₽ в месяц
Один и тот же продукт, одна и та же нагрузка, разница в 30 раз — и это единственное, что в цене ИИ действительно решается архитектурой: моделью, размером контекста и тем, как вы чистите историю.
Кэш, батчи и бесплатные варианты
Кэш входа. У моделей с промпт-кэшем повторный прочитанный блок стоит в разы дешевле: у DeepSeek V4.1 Flash вход — 10 ₽ за 1 млн, а кэшированный вход — 1 ₽. Если системный промпт и база знаний не меняются от запроса к запросу, вы платите за их прочтение один раз.
Пакетный режим. Варианты с суффиксом :batch в каталоге — асинхронная
обработка с ценой ниже обычной (у того же GPT-5.6 Luna выход 120 ₽ против
60 ₽ в батче). Подходит для миграций, разметки датасетов и всего, что может
подождать.
Бесплатные версии. В каталоге есть варианты с суффиксом :free — с
ограничением по числу запросов в неделю. Для экспериментов и прототипа этого
хватает, для продакшена нет: лимит и фактический вендор могут измениться.
Что в этих цифрах не наш
Цены в рублях — наши, розничные, они и списываются с баланса. Скорость и
задержка (ток/с, p50, число токенов за неделю) — это опубликованные
показатели самого провайдера, шлюз передаёт их как есть и ничего не
разгоняет. Если провайдер завышил TPS в своей статистике, в каталоге вы
увидите ровно это завышение.