В подборке — десять крупных моделей для серверных GPU, от 309 миллиардов до 2,8 триллиона параметров. Они расположены преимущественно по размеру; это не рейтинг интеллекта по единому тесту. Доступные веса позволяют самостоятельный запуск, но права на использование определяет лицензия каждой модели. Выбраны полные официальные выпуски, включая нативные форматы низкой точности.
Все модели одним взглядом
Параметры ИИ — числовые коэффициенты, которые модель получает при обучении. Общее количество описывает размер модели; активное — сколько параметров участвует в обработке одного токена. У моделей с экспертами (MoE) эти числа различаются: небольшой активный объём не означает, что остальные веса можно не хранить.
| Модель | Всего обученных параметров ИИ | Активных параметров на токен | Формат весов | Серверный профиль | Аренда в месяц, 24/7 |
|---|---|---|---|---|---|
| Kimi K3 | 2,8 трлн | 104 млрд | Нативный MXFP4 / MXFP8 | 8× B300 (HGX / NVSwitch) | ≈ $45 446 |
| Qwen3.8-2.4T-A95B | 2,4 трлн | 95 млрд | BF16 | 32× B300, 4 узла × 8 | ≈ $181 786* |
| DeepSeek-V4-Pro-0813 | 1,6 трлн | 49 млрд | Нативный FP4 + FP8 | 8× B300 | ≈ $45 446 |
| MiMo-V2.6-Pro-RL | 1,02 трлн | 42 млрд | MXFP4-хранение + FP8/BF16 | 8× B300 | ≈ $45 446 |
| Inkling | 975 млрд | 41 млрд | BF16 | 16× B200, 2 узла × 8 | ≈ $113 587 |
| DeepSeek-V4.1-Flash | 552 млрд + 196 млрд Engram | 8 млрд при чтении / 16 млрд при генерации | MXFP4 + MXFP8 | 8× H200 | ≈ $26 438 |
| GLM-5.3 | ≈743 млрд | ≈39 млрд | Официальный FP8 | 8× B200 | ≈ $39 110 |
| Nemotron 3 Ultra 550B | 550 млрд | 55 млрд | BF16 | 8× B200 | ≈ $39 110 |
| MiniMax-M3 | ≈428 млрд | ≈23 млрд | BF16 | 8× H200 | ≈ $26 438 |
| MiMo-V2.6-Flash-RL | 309 млрд | 15 млрд | MXFP4-хранение + FP8/BF16 | 4× H200 | ≈ $13 219 |
Расчёт на 30 дней непрерывной работы (720 часов), в долларах США, по тарифам на 6 октября 2026 года. Это аренда вычислительных ресурсов: дополнительные диски, налоги, администрирование и отдельные сетевые услуги в суммы не включены. CPU и RAM зависят от выбранного тарифа.
Для одноузловых профилей использованы ставки Runpod: H200 — $4,59, B200 — $6,79, B300 — $7,89 за GPU в час. Для Inkling — тариф Lambda на кластер из 16 B200 с InfiniBand: $9,86 за GPU в час; показан эквивалент 30 дней, условия бронирования — от двух недель.
* Для Qwen указана только оценка GPU по ставке B300. Цена связанного четырёхузлового кластера с RDMA согласуется отдельно: четыре независимых GPU-инстанса его не заменяют. Условия аренды B300 и кластеров.
Числа параметров округлены и взяты из описаний архитектуры. Счётчик тензоров репозитория может включать служебные компоненты и отличаться от числа обученных параметров; расхождения раскрыты ниже. Для DeepSeek V4.1 отдельно показаны основная сеть и память Engram. Для всех профилей выбран стартовый контекст 32 768 токенов и до четырёх последовательностей. Максимальное окно из карточки модели потребует отдельного расчёта памяти.
01 Kimi K3
Самый крупный по заявленному общему числу параметров участник подборки. Мультимодальная модель Moonshot для сложных рассуждений, программирования и работы с визуальными материалами. Веса доступны целиком; MXFP4 здесь — официальный формат выпуска с обучением под низкую точность, а не любительская уменьшенная копия.
Обученных параметров: 2,8 трлн; активных на токен: 104 млрд. Формат: Нативный MXFP4 / MXFP8. Заявленное контекстное окно: 1M токенов (K — тысячи, M — миллионы). Лицензия: Kimi K3 (собственная).
Где скачать. moonshotai/Kimi-K3 — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 8× B300 (HGX / NVSwitch); оперативная память — 2–3 ТБ на узел; SSD — 4 ТБ. B300 выбран в текущем машиночитаемом рецепте vLLM. Независимый запуск официальных весов на 8× B300 опубликован Fixstars, но с SGLang; это не тест наших команд vLLM. Индекс основного набора весов указывает 1560,9 GB (1,561 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $45 446 за 30 дней: 8 GPU × $7.89 × 720 часов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py kimi-k3
bash kimi-k3.sh
Работает с thinking; доступны low, high и max. В многошаговом агенте сохраняйте reasoning_content и tool_calls в истории согласно документации. Образ kimi-k3 использует CUDA 13: нужен драйвер NVIDIA r580+ и совместимая архитектура CPU. Рецепт помечен pre-release: сначала проверяйте на собственных задачах.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="kimi-k3"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
-e VLLM_USE_V2_MODEL_RUNNER=1 \
-e VLLM_ALLREDUCE_USE_FLASHINFER=1 \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--reasoning-parser kimi_k3 \
--tool-call-parser kimi_k3 \
--enable-auto-tool-choice \
--trust-remote-code \
--kv-cache-dtype fp8 \
--load-format fastsafetensors \
--no-enable-flashinfer-autotune \
--attention-backend TOKENSPEED_MLA \
--attention-config '{"use_prefill_query_quantization":true,"mla_prefill_backend":"TOKENSPEED_MLA"}' \
--enable-prefix-caching \
--prefix-match-unit 128 "${EXTRA[@]}"02 Qwen3.8-2.4T-A95B
Флагман Qwen для текстовых задач и длинных рассуждений. В этой статье выбран полный BF16-чекпойнт: его размещение требует нескольких серверов. Не путайте его с облачным Qwen3.8-Max: у скачиваемой версии текстовый ввод и обязательный thinking.
Обученных параметров: 2,4 трлн; активных на токен: 95 млрд. Формат: BF16. Заявленное контекстное окно: 262K → ≈1M токенов (K — тысячи, M — миллионы). Лицензия: Qwen3.8-Max (собственная).
Где скачать. Qwen/Qwen3.8-2.4T-A95B — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 32× B300, 4 узла × 8; оперативная память — 1–2 ТБ на узел; SSD — 8 ТБ на узел. Редакционный профиль с запасом; рецепт оценивает минимум BF16 в 24× B300, с другой топологией параллелизма. Индекс основного набора весов указывает 4892,4 GB (4,892 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $181 786 за 30 дней: 32 GPU × $7.89 × 720 часов. Это ориентир стоимости GPU; итоговую цену кластера с межузловой сетью нужно запросить у провайдера. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py qwen38
# Узел 0: укажите его приватный IP
NODE_RANK=0 HEAD_ADDR=10.0.0.10 NODE_IP=10.0.0.10 bash qwen38.sh
# На каждом следующем узле: скопируйте lock с узла 0
python prepare.py qwen38 --lock /path/to/qwen38.json
# NODE_RANK: от 1 до 3, NODE_IP — адрес текущего узла
NODE_RANK=1 HEAD_ADDR=10.0.0.10 NODE_IP=10.0.0.11 bash qwen38.sh
Нативное окно — 262 144 токена; расширение примерно до миллиона требует отдельной настройки. Для BF16 рецепт указывает 4,45 TiB весов и расчётный бюджет памяти 5 871 GB. TP должен делить 64 головы внимания; поэтому нельзя просто поставить TP=24. Наш TP=32 рассчитан на четыре узла по восемь GPU. Официальный FP8-чекпойнт существует отдельно, но здесь не используется. Для запуска выбран специальный образ qwen38 из текущего рецепта, а не плавающий общий nightly. Версии модели и образа закреплены в архиве; наша BF16-конфигурация TP32 остаётся расчётным профилем, а не опубликованным замером.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="qwen38"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
# На первом узле rank=0; остальные последовательно 1,2,...
: "${NODE_RANK:?Укажите номер узла}"
: "${HEAD_ADDR:?Укажите приватный IP узла 0}"
: "${NODE_IP:?Укажите приватный IP текущего узла}"
[[ "$NODE_RANK" =~ ^[0-9]+$ ]] && (( NODE_RANK < 4 )) || { echo "Неверный NODE_RANK"; exit 1; }
DOCKER_EXTRA+=(-e "VLLM_HOST_IP=$NODE_IP" -e "NCCL_DEBUG=INFO" --cap-add IPC_LOCK)
if [ -d /dev/infiniband ]; then DOCKER_EXTRA+=(--device /dev/infiniband); fi
if [ -n "${NCCL_SOCKET_IFNAME:-}" ]; then DOCKER_EXTRA+=(-e "NCCL_SOCKET_IFNAME=$NCCL_SOCKET_IFNAME"); fi
if [ -n "${GLOO_SOCKET_IFNAME:-}" ]; then DOCKER_EXTRA+=(-e "GLOO_SOCKET_IFNAME=$GLOO_SOCKET_IFNAME"); fi
if [ -n "${NCCL_IB_HCA:-}" ]; then DOCKER_EXTRA+=(-e "NCCL_IB_HCA=$NCCL_IB_HCA"); fi
if [ "$NODE_RANK" -gt 0 ]; then EXTRA+=(--headless); fi
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 32 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--reasoning-parser qwen3 \
--kv-cache-dtype fp8 \
--trust-remote-code \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice \
--distributed-executor-backend mp \
--nnodes 4 \
--node-rank "$NODE_RANK" \
--master-addr "$HEAD_ADDR" "${EXTRA[@]}"03 DeepSeek-V4-Pro-0813
Крупный reasoning-флагман DeepSeek. Нужен именно релиз 0813: он заменяет ранний preview и поставляется с модулем DSpark. Подходит для кода и многошаговых агентных задач; простой API к модели ещё не создаёт самого агента — инструменты и цикл исполнения добавляет приложение.
Обученных параметров: 1,6 трлн; активных на токен: 49 млрд. Формат: Нативный FP4 + FP8. Заявленное контекстное окно: 1M токенов (K — тысячи, M — миллионы). Лицензия: MIT.
Где скачать. deepseek-ai/DeepSeek-V4-Pro-0813 — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 8× B300; оперативная память — 1–2 ТБ; SSD — 3 ТБ. 8× B300 присутствует в рецепте vLLM. Рецепт рекомендует DP+EP для производительности; приведённый TP8 — упрощённый стартовый профиль, не воспроизведённый нами бенчмарк. Индекс основного набора весов указывает 892,7 GB (0,893 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $45 446 за 30 дней: 8 GPU × $7.89 × 720 часов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py deepseek-pro
bash deepseek-pro.sh
1,6T — базовая архитектура; интерфейс Hugging Face показывает около 1,7T с дополнительными компонентами. У 0813 нет обычного Jinja-шаблона чата: требуется deepseek_v4 tokenizer mode. Для первого запуска DSpark отключён; он добавляется после проверки обычной генерации. Режимы high/max требуют гораздо большего бюджета вывода, чем проверочный запрос ниже.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="deepseek-pro"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--kv-cache-dtype fp8 \
--block-size 256 \
--tokenizer-mode deepseek_v4 \
--reasoning-parser deepseek_v4 \
--tool-call-parser deepseek_v4 \
--enable-auto-tool-choice \
--trust-remote-code "${EXTRA[@]}"04 MiMo-V2.6-Pro-RL
Триллионный мультимодальный флагман Xiaomi: текст, изображения, видео и аудио объединены в одной модели. Версия Pro-RL интересна для задач, где нужно соединить анализ материала, рассуждение и работу с инструментами.
Обученных параметров: 1,02 трлн; активных на токен: 42 млрд. Формат: MXFP4-хранение + FP8/BF16. Заявленное контекстное окно: 1M токенов (K — тысячи, M — миллионы). Лицензия: MIT.
Где скачать. XiaomiMiMo/MiMo-V2.6-Pro-RL — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 8× B300; оперативная память — 1,5–2 ТБ; SSD — 3 ТБ. TP8 из карточки разработчика; тип GPU и запас RAM/диска — редакционная оценка. Индекс основного набора весов указывает 566,0 GB (0,566 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $45 446 за 30 дней: 8 GPU × $7.89 × 720 часов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py mimo-pro
bash mimo-pro.sh
Карточка самой V2.6 ссылается на образ mimov25-cu129 и приводит TP8. Это не опечатка в инструкции, но повод обязательно фиксировать digest образа и проверять поддержку конкретной ревизии. Для более сложного распределённого размещения разработчик публикует отдельный SGLang-профиль TP16/EP16 на двух узлах. Не переносите его сетевые флаги в одноузловой запуск. В config.json одновременно указаны quant_method=fp8 и store_dtype=mxfp4: это смешанный выпуск, а не чистый FP8. Объём файлов нельзя приравнивать к памяти после загрузки. Выбранные GPU — консервативный ориентир, не доказанный минимум.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="mimo-pro"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--reasoning-parser mimo \
--tool-call-parser mimo \
--enable-auto-tool-choice \
--generation-config vllm \
--trust-remote-code "${EXTRA[@]}"05 Inkling
Крупная модель Thinking Machines Lab с текстовым, визуальным и звуковым вводом и текстовым ответом. Для этого обзора выбран исходный BF16-репозиторий. Он подходит командам, которым нужен собственный мультимодальный сервис и возможность строить специализированную систему вокруг модели.
Обученных параметров: 975 млрд; активных на токен: 41 млрд. Формат: BF16. Заявленное контекстное окно: 1M токенов (K — тысячи, M — миллионы). Лицензия: Apache 2.0.
Где скачать. thinkingmachines/Inkling — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 16× B200, 2 узла × 8; оперативная память — 1,5–2 ТБ на узел; SSD — 4 ТБ на узел. Редакционный BF16-профиль с запасом; рецепт подтверждает необходимость нескольких узлов для BF16. Индекс основного набора весов указывает 1904,6 GB (1,905 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $113 587 за 30 дней: 16 GPU × $9.86 × 720 часов. В расчёте использован тариф связанного InfiniBand-кластера Lambda, а не сумма отдельных инстансов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py inkling
# Узел 0: укажите его приватный IP
NODE_RANK=0 HEAD_ADDR=10.0.0.10 NODE_IP=10.0.0.10 bash inkling.sh
# На каждом следующем узле: скопируйте lock с узла 0
python prepare.py inkling --lock /path/to/inkling.json
# NODE_RANK: от 1 до 1, NODE_IP — адрес текущего узла
NODE_RANK=1 HEAD_ADDR=10.0.0.10 NODE_IP=10.0.0.11 bash inkling.sh
Рекламируемый запуск на четырёх GB200 относится к отдельной NVFP4-версии, а не к выбранному BF16. В наших командах нет подмены на Inkling-NVFP4. Используется базовый TP без ускоряющего MTP. Рецепт описывает и TP/DP/EP-топологии; оптимизацию межузлового обмена имеет смысл делать после первого успешного запуска. Производитель заявляет 975B, тогда как индекс тензоров этого репозитория даёт около 952B; статья сохраняет заявленный размер и отдельно использует размер файлов для расчёта хранения.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="inkling"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
# На первом узле rank=0; остальные последовательно 1,2,...
: "${NODE_RANK:?Укажите номер узла}"
: "${HEAD_ADDR:?Укажите приватный IP узла 0}"
: "${NODE_IP:?Укажите приватный IP текущего узла}"
[[ "$NODE_RANK" =~ ^[0-9]+$ ]] && (( NODE_RANK < 2 )) || { echo "Неверный NODE_RANK"; exit 1; }
DOCKER_EXTRA+=(-e "VLLM_HOST_IP=$NODE_IP" -e "NCCL_DEBUG=INFO" --cap-add IPC_LOCK)
if [ -d /dev/infiniband ]; then DOCKER_EXTRA+=(--device /dev/infiniband); fi
if [ -n "${NCCL_SOCKET_IFNAME:-}" ]; then DOCKER_EXTRA+=(-e "NCCL_SOCKET_IFNAME=$NCCL_SOCKET_IFNAME"); fi
if [ -n "${GLOO_SOCKET_IFNAME:-}" ]; then DOCKER_EXTRA+=(-e "GLOO_SOCKET_IFNAME=$GLOO_SOCKET_IFNAME"); fi
if [ -n "${NCCL_IB_HCA:-}" ]; then DOCKER_EXTRA+=(-e "NCCL_IB_HCA=$NCCL_IB_HCA"); fi
if [ "$NODE_RANK" -gt 0 ]; then EXTRA+=(--headless); fi
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
-e VLLM_USE_V2_MODEL_RUNNER=1 \
-e FLASH_ATTENTION_CUTE_DSL_CACHE_ENABLED=1 \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 16 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--tokenizer-mode inkling \
--reasoning-parser inkling \
--tool-call-parser inkling \
--enable-auto-tool-choice \
--kernel-config.enable_flashinfer_autotune=False \
--trust-remote-code \
--distributed-executor-backend mp \
--nnodes 2 \
--node-rank "$NODE_RANK" \
--master-addr "$HEAD_ADDR" "${EXTRA[@]}"06 DeepSeek-V4.1-Flash
Свежая крупная DeepSeek с изображениями на входе и необычным разделением вычислений: 8B активных параметров при обработке запроса и 16B при генерации. Flash в названии не означает маленькие веса: отдельная память Engram занимает значительную часть сервера.
Обученных параметров: 552 млрд + 196 млрд Engram; активных на токен: 8 млрд / 16 млрд. Формат: MXFP4 + MXFP8. Заявленное контекстное окно: 1M токенов (K — тысячи, M — миллионы). Лицензия: MIT.
Где скачать. deepseek-ai/DeepSeek-V4.1-Flash — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 8× H200; оперативная память — 1–1,5 ТБ; SSD — 2 ТБ. 8× H200 — консервативный профиль размещения весов и памяти Engram на GPU. В текущем рецепте есть и TP4 с переносом Engram в RAM; его требования и производительность отличаются. Индекс основного набора весов указывает 510,3 GB (0,510 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $26 438 за 30 дней: 8 GPU × $4.59 × 720 часов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py deepseek-flash
bash deepseek-flash.sh
552B — основная сеть, 196B — отдельная память Engram. Значение около 763B в счётчике Hugging Face включает дополнительные тензоры и не заменяет описание архитектуры. В нашем TP8 перенос Engram в CPU явно отключён; DSpark не включён. Нужен runtime с поддержкой deepseek_v41. Не переносите synthetic acceptance из бенчмарков в обслуживание пользователей.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="deepseek-flash"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--tokenizer-mode deepseek_v41 \
--reasoning-parser deepseek_v41 \
--tool-call-parser deepseek_v41 \
--enable-auto-tool-choice \
--trust-remote-code \
--engram-config '{"cpu_offload":false}' "${EXTRA[@]}"07 GLM-5.3
Продолжение серии GLM с акцентом на программирование и продолжительную работу агента. В качестве основной загрузки используется официальный FP8-релиз, а не сторонний NVFP4. Для интерактивного помощника полезно начать с low/high reasoning и измерить задержку.
Обученных параметров: ≈743 млрд; активных на токен: ≈39 млрд. Формат: Официальный FP8. Заявленное контекстное окно: 1M токенов (K — тысячи, M — миллионы). Лицензия: GLM-5.3 (собственная).
Где скачать. zai-org/GLM-5.3 — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 8× B200; оперативная память — 1–1,5 ТБ; SSD — 2 ТБ. Рецепт vLLM рекомендует 8× B200 для полного контекста; старт ниже ограничен 32K. Индекс основного набора весов указывает 755,6 GB (0,756 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $39 110 за 30 дней: 8 GPU × $6.79 × 720 часов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py glm53
bash glm53.sh
Рецепт vLLM описывает архитектуру примерно как 743B/39B; в таблице использованы эти сопоставимые числа. Счётчик тензоров Hugging Face показывает 753B и не является точным числом обученных коэффициентов основной сети. BF16 лежит отдельно в GLM-5.3-BF16. Thinking включён постоянно; parser называется glm47 даже для GLM-5.3.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="glm53"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--kv-cache-dtype fp8 \
--reasoning-parser glm47 \
--tool-call-parser glm47 \
--enable-auto-tool-choice "${EXTRA[@]}"08 Nemotron 3 Ultra 550B
Серверный флагман NVIDIA с гибридной архитектурой Mamba, attention и MoE. Выбран полный BF16-релиз. Это кандидат для корпоративного текстового помощника и агентной системы в инфраструктуре NVIDIA.
Обученных параметров: 550 млрд; активных на токен: 55 млрд. Формат: BF16. Заявленное контекстное окно: до 1M токенов (K — тысячи, M — миллионы). Лицензия: OpenMDW 1.1.
Где скачать. nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16 — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 8× B200; оперативная память — 1,5–2 ТБ; SSD — 3 ТБ. Официальный одноузловой BF16-профиль NVIDIA. Индекс основного набора весов указывает 1121,0 GB (1,121 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $39 110 за 30 дней: 8 GPU × $6.79 × 720 часов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py nemotron
bash nemotron.sh
Разработчик публикует готовый профиль 8× B200 и отдельный многосерверный вариант через Ray. Для знакомства используем обычную генерацию без MTP. Миллионный контекст требует дополнительной настройки; исходный пример NVIDIA запускается с 256K. Русский язык отдельно проверяйте на собственном наборе: он не указан в основном списке поддерживаемых языков карточки. Число 550B относится к названию архитектуры; счётчик тензоров данного чекпойнта показывает около 561B. Память оценивайте по файлам и фактической загрузке.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="nemotron"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--dtype bfloat16 \
--enable-expert-parallel \
--reasoning-parser nemotron_v3 \
--tool-call-parser qwen3_coder \
--enable-auto-tool-choice \
--mamba-ssm-cache-dtype float16 \
--mamba-backend flashinfer \
--enable-mamba-cache-stochastic-rounding \
--mamba-cache-philox-rounds 5 \
--trust-remote-code "${EXTRA[@]}"09 MiniMax-M3
Мультимодальная модель для текста, изображений, видео и агентных сценариев. Здесь используется BF16, что позволяет сравнивать поведение исходных весов без добавления сторонней квантизации. Подойдёт для визуальных рабочих процессов и анализа интерфейсов.
Обученных параметров: ≈428 млрд; активных на токен: ≈23 млрд. Формат: BF16. Заявленное контекстное окно: 1M токенов (K — тысячи, M — миллионы). Лицензия: MiniMax Community.
Где скачать. MiniMaxAI/MiniMax-M3 — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 8× H200; оперативная память — 1–1,5 ТБ; SSD — 2 ТБ. Плотное BF16-размещение из рецепта vLLM; B200 или несколько узлов дадут больше запаса. Индекс основного набора весов указывает 869,2 GB (0,869 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $26 438 за 30 дней: 8 GPU × $4.59 × 720 часов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py minimax
bash minimax.sh
Карточка производителя указывает приблизительно 428B/23B; рецепт vLLM — 427B/26B. В таблице оставлены числа производителя, расхождение раскрыто. Для MSA обязателен block-size 128. Не заменяйте его универсальным шаблоном запуска. Для очень длинного контекста тесный H200-профиль придётся расширять. Базовая позиционная конфигурация содержит 524 288 токенов; до 1M требуется документированное расширение. Наш запуск ограничен 32K.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="minimax"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 8 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--block-size 128 \
--reasoning-parser minimax_m3 \
--tool-call-parser minimax_m3 \
--enable-auto-tool-choice \
--trust-remote-code "${EXTRA[@]}"10 MiMo-V2.6-Flash-RL
Самый компактный участник этой тяжёлой подборки всё равно требует сотен гигабайт памяти GPU. Это самостоятельная архитектура Xiaomi с 309B параметров, а не ужатая копия Pro. Поддерживает текст, изображения, видео и аудио.
Обученных параметров: 309 млрд; активных на токен: 15 млрд. Формат: MXFP4-хранение + FP8/BF16. Заявленное контекстное окно: 1M токенов (K — тысячи, M — миллионы). Лицензия: MIT.
Где скачать. XiaomiMiMo/MiMo-V2.6-Flash-RL — официальный репозиторий с весами и условиями использования. Документация запуска.
Какой сервер. 4× H200; оперативная память — 768 GB–1 ТБ; SSD — 1,5 ТБ. TP4 из карточки V2.6; H200 — аппаратный ориентир связанного рецепта V2.5, требует приёмки на V2.6. Индекс основного набора весов указывает 172,9 GB (0,173 ТБ, десятичные единицы). Дополнительные файлы репозитория, необязательные draft-модули, кэш и контейнер требуют отдельного места; это не измерение VRAM.
Сколько стоит. ≈ $13 219 за 30 дней: 4 GPU × $4.59 × 720 часов. Источник тарифа.
Как установить. Выполните общую подготовку сервера в конце статьи, затем запустите команды из каталога telecobra-ai-setup с активным окружением Python:
python prepare.py mimo-flash
bash mimo-flash.sh
309B — число из описания архитектуры, счётчик файлов Hugging Face показывает около 311B с дополнительными компонентами. Включён за актуальность и сочетание мультимодальности с серверным масштабом. Приведённый TP4 запускайте на отдельном стенде; при большой очереди и длинном контексте переходите на 8 GPU. В config.json одновременно указаны quant_method=fp8 и store_dtype=mxfp4: это смешанный выпуск, а не чистый FP8. Объём файлов нельзя приравнивать к памяти после загрузки. Выбранные GPU — консервативный ориентир, не доказанный минимум.
Размер файлов проверен по индексу весов закреплённой ревизии; формат — по конфигурации модели. Проверка источников — 2026-10-06; полный запуск этого профиля на GPU редакцией не выполнен.
Полная команда Docker и настройки модели
#!/usr/bin/env bash
# Документальный профиль. Редакцией на GPU не запускался.
set -euo pipefail
HERE="$(cd -- "$(dirname -- "${BASH_SOURCE[0]}")" && pwd)"
SLUG="mimo-flash"
LOCK="${LOCK_DIR:-$HERE/locks}/$SLUG.json"
ROOT_MODELS="${ROOT_MODELS:-/srv/ai/models}"
test -f "$LOCK" || { echo "Сначала prepare.py $SLUG"; exit 1; }
IMAGE="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["image_digest"])' "$LOCK")"
REVISION="$(python3 -c 'import json,sys; print(json.load(open(sys.argv[1]))["revision"])' "$LOCK")"
MODEL_DIR="$ROOT_MODELS/$SLUG/$REVISION"
test -f "$MODEL_DIR/config.json"
test -f "$MODEL_DIR/.telecobra-download-complete.json" || { echo "Загрузка не завершена: повторите prepare.py $SLUG"; exit 1; }
EXTRA=()
DOCKER_EXTRA=()
exec docker run --rm --name "tc-$SLUG" --gpus all \
--network host --ipc host --ulimit memlock=-1 --ulimit stack=67108864 \
-v "$MODEL_DIR:/model:ro" \
-e VLLM_ENGINE_READY_TIMEOUT_S=7200 \
-e VLLM_WORKER_MULTIPROC_METHOD=spawn \
"${DOCKER_EXTRA[@]}" \
--entrypoint vllm "$IMAGE" serve /model \
--host 127.0.0.1 \
--port 8000 \
--served-model-name telecobra-model \
--tensor-parallel-size 4 \
--max-model-len 32768 \
--max-num-seqs 4 \
--gpu-memory-utilization 0.90 \
--reasoning-parser mimo \
--tool-call-parser mimo \
--enable-auto-tool-choice \
--generation-config vllm \
--trust-remote-code "${EXTRA[@]}"Общая установка: от сервера до работающего API
Базовый путь — выделенный тестовый Linux-сервер с NVIDIA GPU, Ubuntu 24.04 LTS и совместимым драйвером от провайдера. Для AMD используйте ROCm-рецепт модели: CUDA-контейнеры этого архива туда не подходят.
Для нескольких GPU внутри узла выбирайте HGX/SXM с NVLink или NVSwitch; для нескольких узлов — согласованную RDMA/InfiniBand-сеть. Простого сложения памяти независимых карт недостаточно. Цены выше служат ориентиром аренды GPU: если провайдер выдаёт готовый контейнерный Pod без доступа к Docker, используйте его механизм запуска образа. Команды ниже рассчитаны на Linux-хост, где разрешён Docker.
1. Проверить оборудование
uname -m
nvidia-smi
nvidia-smi topo -m
free -h
df -h /srv
ip -brief addressКоличество карт и память должны совпадать с профилем. Если nvidia-smi не работает, сначала исправьте драйвер с провайдером. Для Kimi K3 с CUDA 13 нужен r580+; для остальных образов сверяйте совместимость драйвера с CUDA контейнера. На GB-платформах проверьте ARM64-поддержку образа.
2. Установить Docker
На готовом GPU-образе этот шаг часто уже выполнен. Команды ниже — для свежей Ubuntu; существующее контейнерное хозяйство требует отдельной проверки пакетов. Основа: документация Docker.
sudo apt-get update
sudo apt-get install -y ca-certificates curl gnupg python3-venv unzip
sudo install -m 0755 -d /etc/apt/keyrings
sudo curl -fsSL https://download.docker.com/linux/ubuntu/gpg \
-o /etc/apt/keyrings/docker.asc
sudo chmod a+r /etc/apt/keyrings/docker.asc
. /etc/os-release
echo "deb [arch=$(dpkg --print-architecture) signed-by=/etc/apt/keyrings/docker.asc] https://download.docker.com/linux/ubuntu $VERSION_CODENAME stable" \
| sudo tee /etc/apt/sources.list.d/docker.list >/dev/null
sudo apt-get update
sudo apt-get install -y docker-ce docker-ce-cli containerd.io \
docker-buildx-plugin docker-compose-plugin
3. Включить доступ контейнеров к GPU
Установите NVIDIA Container Toolkit. Перезапуск Docker затрагивает работающие контейнеры, поэтому эти шаги выполняются на новом выделенном стенде.
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey \
| sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -fsSL https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list \
| sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' \
| sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt-get update
sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
sudo docker run --rm --gpus all ubuntu:24.04 nvidia-smi
Дальнейшие команды выполняйте под учётной записью, которой администратор разрешил доступ к Docker. Членство в группе Docker даёт высокие привилегии; это не обычная группа для всех пользователей. При использовании sudo следите за согласованными правами на файлы.
4. Подготовить загрузчик и каталог
Скопируйте архив на сервер через SCP. Внутри — десять launch-скриптов, загрузчик и описание профилей. Автоматической загрузки всех десяти моделей нет.
unzip server-setup.zip
cd telecobra-ai-setup
python3 -m venv .venv
source .venv/bin/activate
python -m pip install -r requirements.txt
sudo mkdir -p /srv/ai/models
sudo chown "$(id -u):$(id -g)" /srv/ai/models
# Только если репозиторий требует авторизации:
hf auth login
Для открытой загрузки вход можно пропустить. Если требуется принятие лицензии, выполните его в своём аккаунте Hugging Face. Не помещайте токен в публичные скрипты и Dockerfile. Подробности: официальный CLI Hugging Face.
5. Скачать выбранную модель и закрепить версии
Используйте две команды из карточки. Например, для GLM:
python prepare.py glm53
bash glm53.sh
Архив содержит commit SHA официального репозитория и digest контейнера, проверенные 6 октября 2026 года. prepare.py использует эти закреплённые версии, сохраняет их в locks/glm53.json и скачивает весь snapshot. Файл завершения создаётся только после успешной загрузки; наличие одного config.json больше не считается готовностью. Повторный запуск использует тот же lock. Веса лежат в /srv/ai/models/ПРОФИЛЬ/COMMIT_SHA. Для другого диска заранее задайте export ROOT_MODELS=/путь/к/моделям и используйте его и при подготовке, и при запуске. Если передали prepare.py отдельный --root, укажите тот же ROOT_MODELS в launch-команде.
Скрипт подключает веса к контейнеру только для чтения и поднимает API на 127.0.0.1:8000. Исчезнувший или несовместимый контейнер нельзя исправлять случайной заменой на latest: сначала сверяйте рецепт и поддержку архитектуры. Для новой версии создавайте отдельный стенд и сохраняйте старый lock.
trust-remote-code разрешает запуск кода модели внутри контейнера. Изучите зафиксированную ревизию до обработки рабочих данных. Контейнеру не нужны ключи других сервисов, приватные папки или Docker socket.
6. Если узлов несколько
В нашем Qwen-профиле четыре узла по восемь B300; в Inkling — два по восемь B200. Подготовьте узел 0, скопируйте его JSON-lock на остальные и запускайте там prepare.py с --lock. На всех узлах должны совпадать веса, digest и путь внутри контейнера.
HEAD_ADDR — один приватный адрес узла 0, NODE_IP — приватный адрес текущего узла, NODE_RANK — последовательные номера от нуля. NODE_IP передаётся контейнеру как VLLM_HOST_IP. Скрипты используют multiprocessing и проверяют диапазон рангов. Запустите процессы на всех узлах. Скрипт добавляет headless для рабочих узлов. Пока остальные процессы не поднялись, головной узел может ждать.
Distributed runtime и NCCL требуют межузловых портов. Разрешайте их только внутри доверенной приватной сети; согласуйте интерфейс и RDMA с администратором. Не открывайте произвольный диапазон наружу ради устранения таймаута. Для высокой нагрузки TP-профили могут потребовать перехода на EP/DP и дополнительной настройки.
Для RDMA скрипт передаёт устройства /dev/infiniband, если они есть, и разрешает блокировку памяти через IPC_LOCK. Драйвер, OFED/rdma-core, доступность адаптера и правила сети должны быть настроены провайдером. На каждом узле при необходимости задайте реальные имена интерфейсов через NCCL_SOCKET_IFNAME, GLOO_SOCKET_IFNAME и NCCL_IB_HCA: они передаются внутрь контейнера. Включён NCCL_DEBUG=INFO; если сеть неясна, повторите диагностику с более подробными логами. Наличие /dev/infiniband ещё не гарантирует GPUDirect. Проверьте сообщения NET/IB/GDRDMA; NET/Socket означает TCP и возможную резкую потерю скорости. Руководство vLLM по распределённому запуску.
7. Проверить API и результат
curl --fail http://127.0.0.1:8000/v1/models
curl --fail --max-time 600 http://127.0.0.1:8000/v1/chat/completions \
-H 'Content-Type: application/json' \
-d '{
"model": "telecobra-model",
"messages": [{"role":"user","content":"Вычисли 17 × 19. В финальном ответе напиши только число."}],
"max_tokens": 8192,
"temperature": 1
}'
# Замените имя, если выбрали другую модель:
docker logs --tail 100 tc-glm53
Ожидаемый финальный ответ — 323. Это проверка сервиса, не оценка интеллекта. Если finish_reason=length, увеличьте бюджет вывода или уменьшите reasoning effort способом именно этой модели. Единый набор полей reasoning для всех семейств отсутствует.
Для мультимодальности отдельно проверьте изображение, аудио или видео в документированном формате. Текстовый запрос не проверяет энкодеры. Для tools нужны проверка схемы аргументов и повторный ход после результата инструмента.
8. Подключиться с компьютера
# На своём компьютере, отдельный терминал:
ssh -N -L 8000:127.0.0.1:8000 user@GPU_SERVER
# Клиент: http://127.0.0.1:8000/v1
# model: telecobra-model
# Остановка выбранного стенда на сервере:
docker stop tc-glm53
Запросы curl выполняйте во втором SSH-сеансе после сообщения о готовности API. Четыре допустимые последовательности в конфигурации — ограничение планировщика, а не обещание четырёх одновременных запросов полной длины.
Скрипты работают в переднем плане и не включают автоперезапуск. После приёмки настройте supervisor/systemd либо оркестратор, health checks и метрики. Для командного доступа нужен защищённый шлюз с TLS, аутентификацией и ограничением нагрузки. Прямой API из примеров оставляйте на loopback.
Сколько таких мощностей есть в мире — и можно ли их арендовать
Для моделей из этой статьи нужны прежде всего серверные GPU-ускорители NVIDIA H200, B200 и B300, а не просто мощные центральные процессоры. Важно различать установленное оборудование, предложения облачных провайдеров и свободные ресурсы на нужные даты. Это три разных величины.
Точное мировое количество подходящих свободных серверов по открытым источникам установить нельзя. Проверенные источники ниже описывают отдельные кластеры, каталоги оборудования и порядок бронирования; единой полной статистики установленного и свободного парка H200, B200 и B300 они не дают. Поэтому здесь нет выдуманной цифры «в мире осталось столько-то серверов». Данные о поставках чипов, мощности дата-центров в мегаваттах и анонсы будущих строек тоже не показывают, сколько подходящих кластеров можно арендовать сегодня.
Что известно о масштабе
На странице Colossus компания xAI сообщает о расширении одного связанного кластера до 200 000 GPU в феврале 2025 года. Это конкретный пример масштаба уже построенной инфраструктуры, а не оценка всего мирового рынка на октябрь 2026 года. Его нельзя записывать в доступный читателю запас B300: оборудование другого поколения, задачи владельца и возможность аренды — отдельные вопросы. Даже деление этой цифры на восемь дало бы лишь арифметический эквивалент восьмикарточных узлов, а не число свободных серверов.
Для самостоятельного запуска готовой модели из нашей подборки предусмотрены профили на 4–32 GPU. Кластеры на сотни тысяч ускорителей иллюстрируют масштаб индустрии и крупных задач обучения; для одной копии этих моделей такой размер не требуется. Количество одновременно обслуживаемых пользователей, длина контекста и требуемая скорость могут увеличить потребность в ресурсах.
Где искать подходящие серверы
Runpod. В каталоге есть B300; для распределённого запуска предусмотрен отдельный продукт Clusters с межузловой сетью InfiniBand или RoCE. В FAQ указаны два узла, до 16 GPU, для базового доступа и запрос увеличения лимита расходов для более крупных кластеров. Разные блоки страницы называют разные максимальные размеры, поэтому предел конкретного заказа нужно подтверждать в консоли или у поддержки. Наличие B300 в каталоге не доказывает, что именно 32 B300 с подходящей сетью свободны в выбранном регионе.
Lambda. Документация 1-Click Clusters описывает конфигурации на 16–512 H100 или B200 SXM с InfiniBand. Это диапазон размера одного предлагаемого кластера, а не количество свободных GPU у провайдера. При бронировании выбирают регион и срок, отправляют заявку и получают подтверждение. Для профиля Inkling в этой статье нужен вариант с B200; наличие H100 само по себе не подтверждает соответствие этому профилю.
AWS. EC2 Capacity Blocks позволяют искать и резервировать GPU-инстансы на будущие даты с размещением внутри UltraClusters. Доступные типы зависят от региона. AWS отдельно предупреждает, что поддерживаемый в регионе тип инстанса может отсутствовать в отдельных зонах; действуют и региональные квоты аккаунта. Проверять нужно одновременно регион и тип инстанса, объём квоты и доступное предложение бронирования. Приведённые выше цены Runpod и Lambda не являются тарифами AWS.
Почему нельзя просто собрать нужное число карт
Восьмикарточный сервер с быстрой связью между GPU и восемь независимых машин с одной картой дают разные условия для распределённого вывода. У модели, разделённой между устройствами, данные передаются между ними при вычислениях. Для наших многоузловых профилей нужны совместимые узлы и согласованная RDMA-сеть; обычное соединение через интернет не соответствует этим требованиям. Тип GPU, объём памяти и сеть нужно проверять вместе.
В выбранных профилях Qwen требуется четыре узла по восемь B300, а Inkling — два узла по восемь B200. Свободные карты в разных регионах или независимых облаках не составляют такой кластер. Для одноузловых профилей проверяйте, что нужные четыре или восемь GPU выдаются совместно, с необходимыми RAM, SSD и доступом к выбранному способу запуска контейнера. Другой тип ускорителя может потребовать изменения формата весов, числа устройств и программного окружения; это отдельный профиль, а не автоматическая замена.
Что подтвердить до оплаты
Перед заказом отправьте провайдеру точное название модели и формат весов, число узлов и GPU на узел, объём RAM и SSD, требования к межузловой сети, регион, дату старта и длительность аренды. Попросите подтвердить доступность всей конфигурации одновременно, условия продления, доступ к Docker или запуску собственного образа и полную цену с хранением и сетью. Для примера запрос по Qwen здесь — «4 узла × 8 B300, связанная RDMA-сеть, BF16, 30 дней»; RAM и SSD берите из карточки модели выше.
Месячная сумма в нашей таблице — расчёт бюджета, а не подтверждённая бронь. Практический порядок: получить предложение на подходящую конфигурацию, проверить модель на коротком запуске и затем согласовать длительный срок. Если нужного кластера нет на выбранные даты, можно рассмотреть другой регион или провайдера; смена оборудования требует повторной проверки совместимости и производительности.
Источники раздела проверены 7 октября 2026 года. Доступность в личных кабинетах и реальные бронирования редакцией не проверялись; заявки на аренду не отправлялись. Срок ожидания и число свободных серверов без ответа провайдера не заявляем.
Кто уже скачивал, запускал и использует эти модели
Есть три разных вида подтверждений: инженерный отчёт о запуске весов на конкретном оборудовании; предложение модели через API хостинг-провайдера; применение модели в продукте или исследовании. API-каталог подтверждает доступность сервиса, но сам по себе не раскрывает оборудование, точную ревизию весов и владельца серверов. Ниже эти случаи разделены.
Реальные развёртывания с описанием оборудования
Kimi K3 — Fixstars. В инженерном отчёте от 28 июля 2026 года компания описывает загрузку официальных MXFP4-весов и запуск на одном сервере с восемью B300, 3 TiB системной памяти и SGLang 0.5.16. Опубликованы команда, распределение GPU-памяти и замеры. По отчёту, загрузка заняла около часа; время относится к их сети и дискам. Это прямой пример самостоятельной установки, но другого движка, чем vLLM в нашей инструкции. Отчёт Fixstars с командами.
Qwen3.8 — Fixstars. Вторая публикация от 13 августа 2026 года описывает запуск на восьми B300 с SGLang. Существенная деталь: для запуска взят RadixArk NVFP4, а официальный FP8 скачан для сравнения. Это подтверждает практическое развёртывание семейства, но не доказывает, что наш BF16-чекпойнт поместится на восьми GPU: для него в статье оставлен отдельный четырёхузловой профиль. Отчёт Fixstars о Qwen.
GLM-5.3 — Volcengine. Провайдер опубликовал инструкцию развёртывания FP8 на двух инстансах ecs.hpcpni3ln.45xlarge через SGLang: с загрузкой весов, запуском контейнеров и запросом проверки. Это документированный пример конфигурации провайдера; он не является перечнем его клиентов и не подтверждает тест нашего профиля B200/vLLM. Инструкция Volcengine.
Кто предоставляет модели как сервис
Kimi K3 — Fireworks. Fireworks сообщает о своём размещении модели и оптимизации вычислительных ядер. В той же публикации приведены отзывы Replit об использовании K3 в Replit Design, а Cognition и Mercor — об оценивании модели через Fireworks. Это примеры применения и тестирования через сервис, а не свидетельство собственных GPU-кластеров этих клиентов. Публикация Fireworks.
Qwen3.8 и Inkling. DigitalOcean предлагает Qwen3.8-2.4T-A95B через Inference Engine. Together AI отдельно объявила доступность Inkling; Thinking Machines перечисляет также Fireworks, Modal, Databricks и Baseten. Эти публикации подтверждают сервисную доступность, но не тождество их внутренней конфигурации нашим BF16-профилям. DigitalOcean о Qwen; Together AI об Inkling; объявление Thinking Machines.
DeepSeek, MiniMax и MiMo. У Novita есть отдельная карточка DeepSeek V4 Pro 0813, у DeepInfra — DeepSeek V4.1 Flash и MiMo V2.6 Pro/Flash, у Fireworks — MiniMax M3. Это подтверждение наличия моделей в сервисах. У MiMo API-имена не содержат суффикс -RL, поэтому нельзя утверждать, что провайдер обслуживает именно SHA из нашего архива. Именованные корпоративные клиенты, самостоятельно установившие каждый из этих точных чекпойнтов, в проверенных источниках не установлены. Novita: Pro 0813; DeepInfra: V4.1 Flash; MiMo Pro; MiMo Flash; Fireworks: MiniMax M3.
Пример использования открытой основы в собственном продукте
Nemotron 3 Ultra — Sakana AI. NVIDIA в публикации от 6 июля 2026 года сообщает, что Sakana построила Fugu и Fugu-Ultra на основе Nemotron 3 Ultra для работы над автоматизацией исследований. Это применение открытой основы и её адаптации, а не подтверждение запуска неизменённого BF16-чекпойнта из нашей таблицы. Сама Sakana описывает Fugu как систему координации нескольких моделей; состав продукта может меняться. Сообщение NVIDIA; описание продукта Sakana.
Что показывает число скачиваний
В таблице ниже — публичное поле downloads Hugging Face на 6 октября 2026 года, соответствующее отображаемому счётчику скачиваний за последний месяц. Это показатель обращений к репозиторию, а не количество компаний или успешных установок. Hugging Face учитывает запросы к определённым служебным файлам, включая GET/HEAD к конфигурации; полная загрузка всех весов и запуск модели для этого не обязательны. Публичного списка всех установивших модель нет. Как Hugging Face считает скачивания.
| Официальный репозиторий | Счётчик downloads за месяц |
|---|---|
| Kimi K3 | 1 265 400 |
| Qwen3.8-2.4T-A95B | 33 135 |
| DeepSeek-V4-Pro-0813 | 88 451 |
| MiMo-V2.6-Pro-RL | 89 231 |
| Inkling | 922 561 |
| DeepSeek-V4.1-Flash | 1 160 332 |
| GLM-5.3 | 1 489 168 |
| Nemotron 3 Ultra 550B | 561 260 |
| MiniMax-M3 | 192 880 |
| MiMo-V2.6-Flash-RL | 53 382 |
Источники проверены 6 октября 2026 года. Отсутствие найденного публичного кейса не означает, что модель никто не использует. Чужие бенчмарки не подтверждают работоспособность изменённых команд, другого формата весов или другого оборудования.
Профили и команды составлены по документации разработчиков. На указанных GPU редакция их не запускала; стоимость не является предложением провайдера. Перед длительной арендой проверьте выбранную модель на коротком стенде.
