06. Инфраструктура и стоимость (РФ, июль 2026)¶
1. Стоимость аренды GPU (облако)¶
1.1. immers.cloud — почасовая опция GPU¶
Источник: immers.cloud/prices (проверено 07.2026). Скидки при предоплате: 10% (30 дней), 15% (60), 20% (180), 25% (360).
- H200 141GB PCI-E — 390,00 ₽/ч
- H100 NVL 94GB PCI-E — 340,00 ₽/ч
- H100 80GB PCI-E — 320,00 ₽/ч
- A100 80GB PCI-E — 190,00 ₽/ч
- RTX 5090 32GB — 120,00 ₽/ч
- RTX 4090 24GB — 75,00 ₽/ч
- A10 24GB — 30,80 ₽/ч
- Tesla T4 16GB — 16,00 ₽/ч
1.2. immers.cloud — готовые облачные конфигурации (помесячно)¶
- A100 80GB, 1×GPU / 16 vCPU / 64 ГБ RAM / 160 ГБ: 152 474 ₽/мес — immers.cloud/gpu/a100
- A100 80GB, 2×GPU NVLink / 24 vCPU / 96 ГБ: 296 503 ₽/мес — immers.cloud/gpu/a100
- A100 80GB, 8×GPU NVLink / 44 vCPU / 512 ГБ: 1 177 934 ₽/мес — immers.cloud/gpu/a100
- H100 80GB, 1×GPU / 16 vCPU / 64 ГБ / 160 ГБ: 246 074 ₽/мес — immers.cloud/gpu/h100
- H100 80GB, 2×GPU / 24 vCPU / 256 ГБ: 503 978 ₽/мес — immers.cloud/gpu/h100
- H100 80GB, 4×GPU / 44 vCPU / 512 ГБ: 1 005 134 ₽/мес — immers.cloud/gpu/h100
1.3. immers.cloud — выделенные (dedicated) серверы¶
Источник: immers.cloud/dedicated (проверено 07.2026). - A100 80GB ×2 / Xeon 6336Y / 128 ГБ RAM / SSD 7680: 283 356 ₽/мес - A100 80GB ×4 / 2× Xeon 4410Y / 512 ГБ / NVMe 3840: 555 732 ₽/мес
1.4. Selectel — Cloud GPU¶
Источник: selectel.ru/services/cloud/servers (prices), калькулятор: selectel.ru/prices/calculator (проверено 07.2026, НДС 22%). - Линейка GPU (T4, A100, A30, L4, RTX 4090, H100, H200, RTX 6000 Pro и др.) — от 21 999 ₽/мес за базовую конфигурацию; итог считается в калькуляторе от vCPU/RAM/диска/GPU. - Почасовые ориентиры (по обзору tproger, 2026): A100 — 211,77 ₽/ч, H100 — 341,77 ₽/ч, H100 NVL — 367,41 ₽/ч, H200 — 423,04 ₽/ч.
Вывод по аренде: лучший «вход» для инференса 27-35B — 1× A100 80GB (~150 тыс. ₽/мес) или 1× H100 80GB (~246 тыс. ₽/мес). Для роутера/ярус-0 — дешёвые L4/A10/RTX 4090.
3. Не-GPU инфраструктура (managed-сервисы)¶
- Managed PostgreSQL (per-tenant) — pay-as-you-go по vCPU/RAM/диску, расчёт в калькуляторе — selectel.ru/.../postgresql
- Объектное хранилище S3 — стандартное хранение от 2,56 ₽/ГБ/мес + запросы к API + исходящий трафик; входящий и внутренний трафик бесплатны — docs.selectel.ru/s3/payment
- CPU-инстансы / Kubernetes / балансировщики / вектор-БД (Qdrant на VM) — считаются в калькуляторе Selectel.
- Ориентир CPU-обвязки (API Gateway, сервисы, Redis, Kafka, Qdrant, мониторинг): на пилоте ~20-60 тыс. ₽/мес, с ростом — линейно вверх и в HA (×2).
4. Развилка: managed LLM API vs self-hosted GPU¶
4.1. Цены managed LLM¶
Основной кандидат старта — Qwen API (Alibaba Cloud Model Studio, International/Singapore). Оплата по токенам, OpenAI-совместимый эндпоинт (.../compatible-mode/v1). Источники: Model Studio pricing, Qwen Cloud pricing, cloudprice.net/qwen3-max (проверено 07.2026):
| Модель | Роль | Вход, $/1M | Выход, $/1M | Вход, ₽/1M (×90) | Выход, ₽/1M |
|---|---|---|---|---|---|
qwen3.7-max |
ярус-2 / сложное, фолбэк | 2,50 (промо 1,25) | 7,50 (промо 3,75) | ~112 | ~337 |
qwen3.7-plus |
ярус-1 «мозг» | 0,40 | 1,60 | ~36 | ~144 |
qwen3.6-flash |
ярус-0 | 0,25 | 1,50 | ~22 | ~135 |
qwen3.5-flash |
ярус-0 (дёшево, длинный контекст) | 0,10 | 0,40 | ~9 | ~36 |
Дополнительно: implicit cache снижает цену повторного входа (для max — $0,32 вместо $1,6/1M, ~5×) — важно, т.к. системный промпт + RAG повторяются; batch API — −50% (для офлайн-задач, не для realtime-диалога). Тиры по длине контекста: цены выше — для входа ≤256K; при 256K-1M растут.
Альтернативы (РФ, для переноса LLM-слоя): - GigaChat (юрлица, с 01.02.2026, вкл. НДС; async — вдвое дешевле; мин. 600 ₽/мес) — developers.sber.ru/.../legal-tariffs: - Lite — 0,065 ₽ / 1000 токенов (= 65 ₽/1M) - Pro — 0,5 ₽ / 1000 токенов (= 500 ₽/1M) - Max — 0,65 ₽ / 1000 токенов (= 650 ₽/1M) - YandexGPT (ориентир): lite — 0,2 ₽ вход / 0,4 ₽ выход за 1К; полная — 1 ₽ / 2 ₽ за 1К — unoapi.ru: сравнение.
Сопоставление за 1M токенов (вход/выход, ₽): Qwen plus 36/144 ≪ GigaChat Pro 500/500 ≈ YandexGPT полная ~90/180. То есть Qwen plus/flash в разы дешевле GigaChat Pro/YandexGPT full, а по качеству кодинга/рассуждений — сильнее. GigaChat/YandexGPT выигрывают в другом: данные в РФ (152-ФЗ), оплата в рублях, естественный русский «из коробки».
4.4. Критичные оговорки по облачному Qwen¶
- 152-ФЗ / трансграничная передача ПДн. Эндпоинт International — Сингапур. Имя/телефон/адрес лида (персональные данные граждан РФ) уходят за границу. Для платформы, продающей compliance застройщикам, на проде это блокер без одного из: (а) обезличивания/маскирования ПДн перед отправкой в облако (телефоны/имена → плейсхолдеры, восстановление на своей стороне; план и производительность — 05, §8.2); (б) юридического согласия на трансграничную передачу (ст. 12 152-ФЗ) + уведомление РКН; (в) перехода на self-host в РФ для чувствительных тенантов. Рекомендация: на пилоте — маскирование ПДн + обезличенные диалоги; на проде — self-host для тенантов с жёсткими требованиями.
- Оплата из РФ. Alibaba Cloud International требует зарубежную карту/юрлицо. Заложить платёжный контур (нерезидентное юрлицо/партнёр-реселлер) либо использовать российские API (GigaChat/YandexGPT) как основной биллинг-путь.
- Латентность. Сингапур ≈ 150-250 мс RTT из РФ + время генерации. Для текстового чата приемлемо; для голоса (real-time STT+TTS) — заметно, тут предпочтительнее РФ-хостинг/self-host.
- Санкционные/доступностные риски. Внешний вендор может ограничить доступ. Именно поэтому LLM-слой делаем провайдер-агностичным (см. 05, §8) с горячим фолбэком на GigaChat/YandexGPT/self-host.
4.2. Двухъярусная модель LLM и стоимость обращения¶
По решению проекта используем две модели Qwen API:
- qwen3.6-flash — «маленький» дешёвый ярус для простых операционных задач (роутинг, классификация, сбор данных, типовые FAQ);
- qwen3.7-max — «самый умный» ярус для тяжёлых задач, где нужны рассуждение и размышление (сложная квалификация, работа с возражениями, нетривиальные решения).
Базовый сплит: 80% flash / 20% max (настраивается; см. чувствительность ниже).
Стоимость 1 обращения (2 500 вход + 250 выход токенов, ×90 ₽/$):
| Ярус | ₽ / обращение |
|---|---|
qwen3.6-flash |
0,090 ₽ |
qwen3.7-max (промо) |
0,366 ₽ |
| Микс 80/20 (базовый) | ≈ 0,145 ₽ |
Отсюда LLM ≈ 1 959 ₽ на тенанта в месяц (при 30 лидов/день × 15 обращений × 30 дней = 13 500 обращений/тенант/мес).
Чувствительность (рычаги стоимости):
- всё на flash (90/10): ~0,10-0,12 ₽/обр → дешевле базы на ~20-38%;
- больше рассуждений (70/30): ~0,17 ₽/обр → дороже базы на ~19%;
- ввести средний ярус qwen3.7-plus (0,126 ₽/обр) вместо части max → микс 70/25/5 ≈ 0,113 ₽/обр (−22% к базе). Рекомендуемая оптимизация, когда качество plus достаточно.
4.3. Точка окупаемости self-host (справочно)¶
Аренда GPU становится дешевле Qwen API (микс 80/20, 0,145 ₽/обр) начиная с:
| Порог сравнения | ≈ лидов/день | ≈ тенантов (30 лидов/тенанта) |
|---|---|---|
| 1× A100 80GB = 152 474 ₽/мес | ~2 335 | ~78 |
| 1× H100 80GB = 246 074 ₽/мес | ~3 768 | ~126 |
Вывод: при дорогом ярусе max точка окупаемости смещается в район ~100 тенантов — что совпадает с началом этапа 3. Поэтому переход на аренду GPU на этапе 3 обоснован и по цене, и по 152-ФЗ / контролю / латентности (см. 4.4).
5. Оценка стоимости по этапам (по числу тенантов, с длительностью)¶
5.0. Допущения расчёта¶
| Параметр | Значение |
|---|---|
| «Пользователь» | = тенант (компания-клиент платформы) |
| Лидов/день на 1 тенанта | 30 (мин) … 1000 (макс) |
| Обращений к LLM на 1 лид | 15 |
| Токенов на обращение | 2 500 вход + 250 выход |
| Курс | 90 ₽/$ |
| Ярусы LLM (этапы 1-2) | qwen3.6-flash 80% + qwen3.7-max 20% |
| ₽/обращение (микс 80/20) | ≈ 0,145 ₽ |
| LLM на 1 тенанта/мес | ≈ 1 959 ₽ (30 лидов) … ≈ 65 306 ₽ (1000 лидов) |
| Инфра (CPU/БД/S3/K8s) | аренда с 1-го дня (Selectel/immers), РФ |
| GPU | только этап 3 (аренда, динамический сайзинг по нагрузке) |
min этапа = нижняя граница тенантов × 30 лидов/день + нижняя оценка инфры (консервативный сценарий). max = верхняя граница тенантов × 1000 лидов/день + верхняя оценка инфры и HA (агрессивный потолок). Разброс широкий сознательно — он показывает «сколько минимум» и «сколько максимум» может понадобиться. Реальные значения обычно ближе к нижней/средней части диапазона. Суммы — порядок величины; финализируются в калькуляторах Selectel и immers.cloud. Не включены: команда/ФОТ, платные каналы (WhatsApp Business API, телефония, SMS) — см. §6.
5.1. Этап 1 — Пилот · 1-20 тенантов · Qwen API + маскирование ПДн · 3 месяца¶
| Компонент | мин (1 тенант × 30 лидов) | макс (20 тенантов × 1000 лидов) | Источник |
|---|---|---|---|
LLM — Qwen API (flash+max) |
~1 959 ₽ | ~1 306 125 ₽ | Model Studio pricing |
| Инфра: CPU-сервисы + Managed PostgreSQL + S3 + Qdrant (аренда) | ~25 000 ₽ | ~90 000 ₽ | Selectel калькулятор, S3 |
| Итого, ₽/мес | ~27 тыс. | ~1,40 млн | |
| За 3 месяца | ~81 тыс. | ~4,19 млн |
5.2. Этап 2 — Рост · 20-100 тенантов · Qwen API · 3 месяца¶
| Компонент | мин (20 тенантов × 30 лидов) | макс (100 тенантов × 1000 лидов) | Источник |
|---|---|---|---|
LLM — Qwen API (flash+max) |
~39 184 ₽ | ~6 530 625 ₽ | Model Studio pricing |
| Инфра: БД (HA, per-tenant) + S3 + Qdrant + CPU-сервисы в HA + K8s + мониторинг | ~120 000 ₽ | ~400 000 ₽ | Selectel калькулятор, Managed PostgreSQL |
| Итого, ₽/мес | ~159 тыс. | ~6,93 млн | |
| За 3 месяца | ~478 тыс. | ~20,79 млн |
При высокой нагрузке (близко к 1000 лидов/тенанта) стоимость Qwen API резко растёт — в этой зоне экономически выгоднее раньше перейти на аренду GPU (см. §4.3). Верхняя граница здесь — теоретический потолок «полный этап × максимальная нагрузка».
5.3. Этап 3 — Масштаб · 100-1000 тенантов · аренда GPU · бессрочно (прогноз ₽/мес)¶
На этом этапе LLM переезжает на self-hosted Qwen в РФ (аренда GPU). «Мозг» — открытые веса Qwen 27-35B (проприетарный max доступен только в облаке; самые тяжёлые случаи можно роутить в облачный qwen3.7-max как burst обезличенно). Ярус-0 (flash-задачи) — малый Qwen 4-8B на дешёвых GPU. Число GPU считается динамически по пиковой нагрузке (20% дневного объёма в час; H100 ≈ 6 обр/сек «мозг», A10/L4 ≈ 20 обр/сек ярус-0).
| Компонент | мин (100 тенантов × 30 лидов) | макс (1000 тенантов × 1000 лидов) | Источник |
|---|---|---|---|
| Нагрузка | 3 тыс. лидов/день (~2,5 обр/сек пик) | 1 млн лидов/день (~833 обр/сек пик) | расчёт |
| GPU «мозг» (H100) | 2× H100 ≈ 492 148 ₽ | 28× H100 ≈ 6 890 072 ₽ | immers.cloud/gpu/h100 |
| GPU ярус-0 (A10/L4) | 2× A10 ≈ 44 968 ₽ | 34× A10 ≈ 764 456 ₽ | immers.cloud/prices |
| Инфра: БД/вектор/хранилище в HA + CPU + сеть + observability + резерв | ~450 000 ₽ | ~1 400 000 ₽ | Selectel калькулятор |
| Итого, ₽/мес | ~0,99 млн | ~9,05 млн |
Верхняя граница (1000 тенантов × 1000 лидов = 1 млн лидов/день) — гиперскейл; при таких объёмах разумны покупка/лизинг железа и мультирегион. Аренда vs покупка: сервер 8× H100 ≈ 22-35 млн ₽ единоразово (см. §2); окупаемость ~12-24 мес при высокой утилизации.
5.4. Сводка: сколько денег нужно по этапам¶
| Этап | Длительность | ₽/мес мин | ₽/мес макс | За период мин | За период макс |
|---|---|---|---|---|---|
| 1 — Пилот (1-20 тенантов) | 3 мес | ~27 тыс. | ~1,40 млн | ~81 тыс. | ~4,19 млн |
| 2 — Рост (20-100 тенантов) | 3 мес | ~159 тыс. | ~6,93 млн | ~478 тыс. | ~20,79 млн |
| Старт (этапы 1+2) | 6 мес | — | — | ~558 тыс. | ~24,98 млн |
| 3 — Масштаб (100-1000 тенантов) | бессрочно | ~0,99 млн | ~9,05 млн | — (в месяц) | — (в месяц) |
Итого на запуск (первые 6 месяцев): от ~558 тыс. ₽ (консервативно: мало тенантов, 30 лидов/день) до ~24,98 млн ₽ (агрессивный потолок: полные этапы, 1000 лидов/день на тенанта). Реалистичный бюджет обычно в нижней-средней части диапазона; уточняется по фактическому числу тенантов и их нагрузке (лист «Этапы» и «Графики» в Excel-модели).
6. Удельная экономика (₽/лид) и что не входит¶
Стоимость на лид (только инфраструктура, база 80/20):
- LLM на лид почти не зависит от масштаба: 15 обращений × 0,145 ₽ ≈ 2,2 ₽/лид (всё на flash ≈ 1,4 ₽; всё на max ≈ 5,5 ₽). Это «переменная» часть — растёт линейно с числом лидов.
- Инфра/GPU на лид падает с ростом нагрузки (амортизируется по объёму): этап 1 при 1 тенанте × 30 лидов ≈ 30 ₽/лид; этап 3 при 1000 тенантов × 1000 лидов ≈ 0,3 ₽/лид.
- Диапазон полной удельной стоимости по этапам: ~0,3 … ~30 ₽/лид (низ — гиперскейл, верх — стартовый пилот с минимальной загрузкой).
Не включено в расчёт (фиксируется отдельно с моделью монетизации, см. 00-overview.md): команда и MLOps/SRE (обычно крупнейшая статья), платные каналы (WhatsApp Business API за диалоги, телефония поминутно, SMS), лицензии/мониторинг, платёжный контур для оплаты Alibaba из РФ.
7. Итоговые рекомендации по инфраструктуре¶
- LLM-слой — провайдер-агностичный с первого дня (OpenAI-совместимый интерфейс + адаптеры), чтобы переключать Qwen ↔ GigaChat ↔ YandexGPT ↔ self-host конфигом за ~час (см. 05, §8).
- Этап 1 (Пилот, 1-20 тенантов, 3 мес): Qwen API —
qwen3.6-flashдля операционки +qwen3.7-maxдля рассуждений, с маскированием ПДн (см. 05, §8.2). Без capex. Резерв — GigaChat/YandexGPT. - Этап 2 (Рост, 20-100 тенантов, 3 мес): тот же Qwen API; наращиваем HA для данных, K8s-автоскейл, observability. GPU пока не поднимаем.
- Этап 3 (Масштаб, 100-1000 тенантов, бессрочно): LLM на self-hosted Qwen в РФ (аренда GPU): «мозг» на открытых весах 27-35B + малый Qwen для ярус-0; облачный
qwen3.7-max— burst для самых тяжёлых случаев (обезличенно). Обосновано и по цене (точка окупаемости ~100 тенантов), и по 152-ФЗ / контролю. - Инфра-обвязка (CPU, БД, S3, вектор, K8s) — аренда/облако в РФ (Selectel/immers) с 1-го дня на всех этапах: дёшево и 152-ФЗ соблюдён для данных, которые не уходят в LLM.
- Все расчёты финализировать в калькуляторах: Selectel, immers.cloud; токены Qwen — в Model Studio pricing.