AI infrastructure / Kazakhstan

GPU-серверы.
Без границ
для ваших идей.

GPU-серверы для бизнеса в Казахстане.
NVIDIA HGX / NVL · AMD Instinct · Huawei Ascend
Покупка, аренда и подготовка к запуску.

ТОО «ОМНАР» / КАЗАХСТАН / B2B
OMNAR / COMPUTE
01 — 08
Суммарная GPU-память2 160 GB
Ускорители08 GPU
ЭКОСИСТЕМЫ И НАГРУЗКИNVIDIA HGXAMD InstinctHuawei AscendLLM / INFERENCETRAINING / HPC
01 / Оборудование

Мощность под ваш масштаб.

Сравните платформы и выберите конфигурацию под вашу задачу.

Спецификации проверены: 06.10.2026
13 / 13
NVIDIABlackwell Ultra
Supermicro SYS-822GS-NB3RT · пример сервера

HGX B300 · 8 GPU

Восемь GPU Blackwell Ultra с NVLink 5 Switch. Комплектация и режим охлаждения согласуются с производителем сервера.

Память ускорителей
2 160 GB
Архитектура и среда
SXM6 · NVLink 5 SwitchCUDA
от $634 046
NVIDIABlackwell
Supermicro SYS-822GS-NBRT · пример сервера

HGX B200 · 8 GPU

Восемь GPU Blackwell в одном домене NVLink. Сервер и охлаждение подбираются под инфраструктуру.

Память ускорителей
1 440 GB
Архитектура и среда
SXM6 · NVLink 5 SwitchCUDA
от $480 285
NVIDIAДля больших моделей
Supermicro SYS-821GE-TNHR · пример сервера

HGX H200 · 8 GPU

Обучение и инференс на восьми ускорителях с высокоскоростной связью.

Память ускорителей
1 128 GB
Архитектура и среда
SXM5 · NVSwitchCUDA
от $404 504
NVIDIAГибкая платформа
Supermicro SYS-422GA-NRT · пример сервера

H200 NVL · 8 GPU

Восемь PCIe GPU: два домена NVLink по четыре GPU. Совместимость сервера и мостов подтверждается в КП.

Память ускорителей
1 128 GB
Архитектура и среда
PCIe · 2 × NVLinkCUDA
от $469 168
AMD2.3 TB HBM3e
Supermicro AS-A126GS-TNMR · пример сервера

Instinct MI355X · 8 GPU

Восемь GPU MI355X. Тип охлаждения, лимиты мощности и требования к площадке зависят от сервера и согласуются в КП.

Память ускорителей
2 304 GB
Архитектура и среда
OAM · Infinity FabricROCm
от $402 824
AMD2 TB HBM3e
Supermicro AS-8126GS-TNMR · пример сервера

Instinct MI325X · 8 GPU

Восемь ускорителей для задач с высокими требованиями к памяти.

Память ускорителей
2 048 GB
Архитектура и среда
OAM · Infinity FabricROCm
По запросу
Показано: 6 / 13

На фото — пример готовой системы с этой платформой. Точный корпус, число установленных ускорителей и комплектация фиксируются в КП.

Цены — ориентиры для планирования бюджета, не оферта и не подтверждение наличия. НДС, точная комплектация, доставка, гарантия и срок фиксируются в коммерческом предложении. Память ускорителей указана суммарно; её использование зависит от программного обеспечения и топологии связи.

Подбор платформы

Выберите модель. Сравните память и стоимость.

Только инференс

Платформы 13

Фильтры
Тип платформы
GLM-5.3 · FP8 / BF16 / F32 · Резерв: 128 GB · По памяти: подходящие сначала
ПлатформаПамятьРезультат расчётаОбсудить конфигурацию
H200 NVL · 8 GPUNVIDIA · CUDAот $469 1681 128 GBПо памяти подходитостаётся 244,4 GB
HGX H200 · 8 GPUNVIDIA · CUDAот $404 5041 128 GBПо памяти подходитостаётся 244,4 GB
HGX B200 · 8 GPUNVIDIA · CUDAот $480 2851 440 GBПо памяти подходитостаётся 556,4 GB
Instinct MI300X · 8 GPUAMD · ROCmот $356 1681 536 GBПо памяти подходитостаётся 652,4 GB
Instinct MI325X · 8 GPUAMD · ROCmПо запросу2 048 GBПо памяти подходитостаётся 1 164,4 GB
HGX B300 · 8 GPUNVIDIA · CUDAот $634 0462 160 GBПо памяти подходитостаётся 1 276,4 GB
Показано 6/13

Номинальная память — оценка ёмкости. Сборка, ПО, топология и доступность проверяются отдельно.

Проверка источников:
Как оценить память для LLM
Расчёт и источники

GLM-5.3

753 млрд — параметров в чекпойнте. 39 млрд — активны на токен.

Опубликованный чекпойнт: FP8 / BF16 / F32. Объём весов из опубликованного чекпойнта или официального руководства. Это размер сохранённых весов, не замер GPU-памяти: преобразование при запуске может увеличить объём. Резерв добавлен отдельно.

Формат весов: Начинайте с опубликованного чекпойнта. Дополнительное квантование может влиять на качество; перевод уже квантованных весов в BF16 не восстанавливает потерянную точность.

Рабочий резерв: Память сверх весов для KV-кэша, активаций, рабочих буферов и запаса на всю выбранную конфигурацию, а не на одну GPU. Задавайте по длине контекста и числу одновременных запросов, затем проверяйте пиковый расход. Быстрые значения — примеры, а не универсальные рекомендации.

Карточка модели ↗Объём опубликованных весов ↗Опубликованное руководство запуска ↗

Это предел, указанный в конфигурации модели, а не контекст, проверенный на выбранном оборудовании.

DSA использует kv_lora_rank=512 и индексаторы full/shared. Для кэша нужен расчёт с учётом этой архитектуры.

Config модели ↗

Config контекста проверен: .

Нужна проверка среды исполнения. Опубликованное руководство запуска: HGX H200 · 8 GPU, Instinct MI355X · 8 GPU, Instinct MI325X · 8 GPU, Instinct MI300X · 8 GPU.

Как читать расчёт

Веса = все параметры × байт на параметр: BF16 — 2, FP8 — 1, INT4 — 0,5. Единицы — десятичные GB. Для MoE учитываются все эксперты, а не только активные параметры. Это нижняя оценка: масштабы квантования, слои без квантования и метаданные отдельно не рассчитаны; они должны помещаться в резерв.

Зелёный статус — оценка вместимости, а не проверенный запуск. Память распределена между GPU. Нужно проверить тензорный и экспертный параллелизм, межсоединения, ядра и поддержку фреймворка. Длинный контекст и параллельные пользователи могут потребовать гораздо больший резерв. Для дообучения и обучения нужен отдельный расчёт.

KV-кэш зависит от длины контекста, одновременных запросов, точности кэша и архитектуры внимания модели. Скользящее окно, линейное внимание и сжатый кэш требуют отдельной оценки; пиковый расход проверяется в выбранной среде исполнения. Поле меняет оценку вместимости, а не настройки сервера.

Hugging Face: Стратегии KV-кэша ↗vLLM: Распределение гибридного кэша ↗
  • По памяти подходит. Расчётный бюджет помещается. Нужна проверка ПО, распределения модели и скорости.
  • Небольшой запас. При этом резерве свободно менее 10%. До выбора нужен замер расхода памяти.
  • Не хватает памяти. Сценарий превышает суммарную GPU-память. Измените точность или платформу.

BF16 / FP8 / INT4 — сценарии объёма. Названия форматов не подтверждают нативную поддержку на GPU и одинаковое качество модели.

Для NVL отдельно проверяются топология и распределение модели: PCIe-сервер с 8 GPU не эквивалентен фабрике HGX/NVSwitch. Перед запуском нужно проверить конкретный чекпойнт и ядра в ROCm.

Huawei Ascend использует CANN. Результат по памяти не подтверждает запуск выбранного чекпойнта, операторов или точности на этих платформах. Нужны порт модели и проверка среды исполнения.

По спецификации NVIDIA в расчёте используется 270 GB на GPU для HGX B300 и 279 GB на GPU для GB300. Значение 288 GB не используется. Оперативная память CPU не прибавляется к GPU-памяти. NVIDIA Blackwell Ultra (PDF) ↗

02 / Аренда инфраструктуры

Нужен результат.
Не обязательно
владеть сервером.

Обсудим выделенную конфигурацию под вашу нагрузку. Срок аренды, размещение, доступ и условия поддержки согласуем до запуска.

Рассчитать аренду↗
01
LLM и AI-инференсМодели, RAG и корпоративные AI-сервисы
02
Обучение и fine-tuningПодбор памяти, связности и хранения
03
Computer vision и HPCВычисления под конкретную рабочую нагрузку
03 / Как мы работаем

От задачи —
к конфигурации.

От первой спецификации до передачи оборудования. Работаем с компаниями в Казахстане и подбираем инфраструктуру под конкретную нагрузку.

01 /

Разбираем нагрузку

Модель, точность, объём памяти, число пользователей и целевая производительность.

02 /

Сравниваем варианты

NVIDIA, AMD или Huawei. Сравниваем память, связи между ускорителями, программную совместимость и стоимость владения.

03 /

Согласуем поставку

Спецификация, проверка оборудования, договор, оплата по счёту и условия гарантии.

Поставка по Казахстану

Глобальные технологии.
Локальный партнёр.

OMNAR — казахстанский поставщик GPU-серверов. Подбираем оборудование для компаний в Казахстане, готовим предложения на покупку и выделенную аренду.

01 / CONFIGUREПроектЗадача и конфигурация
02 / OPERATEЗапускПоставка и приёмка
Спецификация → договор → поставка → приёмка
01

Договор с ТОО «Омнар»

Казахстанское юридическое лицо, расчёт предложения в тенге и оплата по счёту.

02

Цена с понятным составом

Оборудование, доставка, налоги и дополнительные услуги раскрываются в коммерческом предложении.

03

Ваш формат инфраструктуры

Сервер на вашей площадке или выделенная аренда с согласованным размещением и доступом.

Начните со своей задачи.

Три отправные точки для разговора об инфраструктуре.

01 /

AI-сервис для команды

Зафиксируйте модель, контекст, число пользователей и допустимое время ответа.

Что подготовить
02 /

Обучение и эксперименты

Опишите данные, методы дообучения и длительность запусков. Сравните покупку с арендой на одном сценарии.

Что подготовить
03 /

Собственная инфраструктура

Проверьте площадку, питание, охлаждение и сеть до согласования серверов или целой стойки.

Что подготовить

Ответы, которые помогают выбрать.

Подробности собраны в отдельных руководствах — от первой оценки памяти до приёмки сервера.

Все материалы →
Давайте начнём

Какая задача
стоит перед вами?

Расскажите о модели и планируемой нагрузке. Отправьте запрос на сервер или аренду — с важными деталями для подготовки предложения.

Специалист по AI-инфраструктуре за ноутбуком
Отдел продажsales@omnar.kzПочта готовится к запуску. Запрос можно отправить через форму.

Все поля обязательны.

Согласие не включает рекламные рассылки. Отправка запроса не создаёт заказ и не обязывает к покупке.

По кнопке «Отправить запрос» данные и согласие передаются в OMNAR. Не указывайте ИИН, документы, пароли и сведения, не связанные с запросом.

Полезно знать

До первого запуска.

Как выбрать между NVIDIA, AMD и Huawei?

Начните с вашей модели и программного стека: CUDA для NVIDIA, ROCm для AMD и CANN для Huawei. Затем проверьте формат весов, распределение памяти и производительность на реальной нагрузке. Одинаковый объём памяти не делает платформы взаимозаменяемыми.

Что означают цены в каталоге?

Цена зависит от комплектации и условий поставки. Запросите коммерческое предложение с итоговой стоимостью в тенге, указанием НДС, сроком поставки и гарантией. Наличие подтверждается в КП.

Чем 8 × H200 NVL отличаются от HGX?

HGX H200 использует платформу SXM с NVSwitch. PCIe-сборка на H200 NVL требует проверки совместимости и может состоять из двух групп по четыре GPU. Это не эквивалент единой восьмичиповой фабрики HGX.

Как согласуется аренда?

Уточняются конфигурация, срок, дата-центр, подключение, режим доступа и поддержка. Доступность мощностей и дата начала подтверждаются индивидуально; мгновенный запуск не обещается.