TensorRT-LLM
Beberapa persen terakhir throughput GPU, dibayar dengan kompleksitas build dan lock-in hardware.
Kalau vLLM dan SGLang memberi default yang kuat dengan cepat, TensorRT-LLM meminta Anda mengompilasi engine per model, per konfigurasi GPU, per presisi — dan memberi throughput di puncak kemampuan hardware. Pertukaran itu masuk akal saat Anda melayani satu atau dua model pada volume sangat tinggi di hardware yang sudah diketahui. Jauh kurang masuk akal saat fase evaluasi, ketika model dan hardware masih berubah tiap minggu. Harapkan langkah build jadi bagian pipeline deployment Anda, bukan kejadian satu kali.
Cocok untuk: Serving volume tinggi untuk set model stabil di hardware NVIDIA tetap