БЕНЧМАРКИНГ ВЫВОДА БОЛЬШИХ ЯЗЫКОВЫХ МОДЕЛЕЙ НА HPC-КЛАСТЕРАХ: ЗАДЕРЖКА, ПРОПУСКНАЯ СПОСОБНОСТЬ И ЭНЕРГОЭФФЕКТИВНОСТЬ

Исмайылов , Эльвиз

Муҳандислик ва Иқтисодиёт · 2026-yil

Annotatsiya

В данной статье представлено комплексное исследование производительности вывода большихязыковых моделей (LLM) на высокопроизводительных вычислительных HPC-кластерах. Экспериментыпроводились с четырьмя моделями — LLaMA-3-70B, Mixtral-8x7B, Falcon-40B и Gemma-2-27B — с использованиемразличных конфигураций квантизации: FP16, INT8, INT4, а также фреймворков vLLM и TensorRT-LLM.Оцениваются три ключевых показателя: задержка первого токена (TTFT), пропускная способность (токенов/с) иэнергоэффективность (Дж/токен). Результаты свидетельствуют о том, что INT4-квантизация с параллелизмомтензоров на 4 GPU обеспечивает оптимальный баланс между скоростью и потреблением энергии, достигаяснижения задержки до 84% при росте пропускной способности в 8,2 раза по сравнению с однопроцессорнымFP16-выводом.

Maqola ma’lumotlari
MualliflarИсмайылов , Эльвиз
JurnalМуҳандислик ва Иқтисодиёт
Nashr sanasi2026-06-01
Jild4
Son6
TilRus

Kalit so‘zlar

большие языковые модели, HPC-кластеры, бенчмаркинг, задержка вывода, пропускная способность, энергоэффективность, квантизация, vLLM, TensorRT-LLM, параллелизм тензоров.

Ilmiy soha

Муҳандислик ва Иқтисодиёт jurnalidan boshqa maqolalar

Муҳандислик ва Иқтисодиёт — barcha maqolalar