A conversa que acontece em todas as reuniões de infraestrutura de IA
Diretor de TI: “Precisamos de GPUs para inferência. A engenharia quer H100s.”
Arquiteto de Infraestrutura: “Eles precisam de 80 GB de HBM3 e FP8 Transformer Engine para servir um modelo 7B ajustado??”
Diretor de TI: “…Eles disseram H100.”
Arquiteto de Infraestrutura: “Eles precisam de um L40S. Metade do orçamento de energia, 30% do custo, e ele lida com a carga de trabalho de inferência sem suar a camisa. Vamos gastar o orçamento do H100 no cluster de formação onde realmente importa.”
Essa conversa acontece porque o mercado de GPU se segmenta claramente em GPUs de treinamento e GPUs de inferência – e confundir os dois é a maneira mais rápida de gastar demais em infraestrutura de IA. O NVIDIA L40S é o carro-chefe da inferência: 48 GB GDDR6 com ECC, PCIe Gen4 x16, e TDP de 300 W em um formato de slot duplo que cabe em servidores padrão refrigerados a ar.
Especificações técnicas
| Parâmetro | Especificação |
|---|---|
| Arquitetura GPU | NVIDIA Ada Lovelace |
| CUDA Cores | 18,176 |
| Núcleos tensoriais | 568 (4ª geração) |
| Núcleos RT | 142 (3Terceira Geração) |
| Memória | 48 GB GDDR6 com ECC |
| Largura de banda de memória | 864 GB/s |
| Barramento de memória | 384-pedaço |
| Interface | PCIe 4.0 x16 |
| Desempenho FP32 (não Tensor) | 91.6 TFLOPS |
| Núcleo Tensor TF32 | 183 TFLOPS (com escassez: 366 TFLOPS) |
| Núcleo Tensor FP16 | 362 TFLOPS (com escassez: 733 TFLOPS) |
| Núcleo Tensor INT8 | 733 TOPOS (com escassez: 1,466 TOPOS) |
| Núcleo Tensor FP8 | 733 TFLOPS (com escassez: 1,466 TFLOPS) |
| TDP (máx.) | 300C |
| Fator de forma | Slot duplo, altura total, comprimento total (FHFL), resfriamento passivo |
| Conector de alimentação | 1x PCIe CEM de 16 pinos (12VHPER) ou 1x alimentação de CPU de 8 pinos |
| NVLink / NVSwitch | Não compatível (inferência de GPU única, sem estrutura multi-GPU) |
| MEU (GPU multi-instância) | Não compatível (use A100 ou H100 para cargas de trabalho MIG) |
| Suporte para vGPU | NVIDIA vWS, vPC, vApps — compatível com VDI e virtualização |
| Memória ECC | ECC completo em GDDR6 (nem todas as GPUs GDDR6 oferecem ECC – o L40S oferece) |
| Dimensões Físicas | 267 x 112 milímetros (slot duplo), 1.35 kg |
| Temperatura operacional | 0°C a 45 °C |
| Garantia | 3-ano (fabricante) |
L40S vs H100 vs A100 – Qual GPU para sua carga de trabalho?
| Carga de trabalho | L40S | A100 80GB | H100 80GB |
|---|---|---|---|
| Inferência LLM (7Modelos B-13B, FP16) | Excelente. 48GB cabe na maioria dos modelos 13B. | Exagero, a menos que execute vários modelos simultaneamente. | Exagero. A inferência do FP8 é mais rápida, mas não é necessária nesta escala. |
| Inferência LLM (70Modelos B+) | Lutas. 48GB insuficiente para modelos 70B sem quantização. | Bom com quantização INT8. 80GB cabe em modelos 70B. | Melhor. 8º PQ + Transformer Engine para rendimento máximo. |
| Treinamento completo do modelo (70B+) | Não recomendado. Sem NVLink, memória limitada. | Aceitável para ajuste fino. Necessidades completas de treinamento NVLink. | Melhor. NVSwitch + HBM3 para treinamento multi-GPU. |
| Afinação (LoRA, QLoRA, 7B-13B) | Excelente. 48GB + FP16 é suficiente. | Bom, mas mais caro do que o necessário. | Exagero. Gaste as economias em mais unidades L40S. |
| VDI / Áreas de trabalho virtuais | Excelente. vGPU + 48GB suporta 6-12 usuários simultâneos. | Bom, mas caro por usuário. | Não projetado para cargas de trabalho VDI. |
| Renderização / Cargas de trabalho RTX | Excelente. Núcleos RT + 18K CUDA cores. | Sem núcleos RT. Não projetado para renderização. | Sem núcleos RT. |
| Simulação de HPC (FP64) | Não recomendado. Sem núcleos tensores FP64. | Bom. Núcleos tensores FP64 habilitados. | FP64 limitado em comparação com A100. |
| Preço (em relação a H100) | ~25-30% | ~55-65% | 100% (linha de base) |
Plataformas de servidor compatíveis
O L40S é um PCIe 4.0 Placa FHFL x16 de slot duplo compatível com qualquer servidor que suporte fornecimento de energia de GPU de 300 W por meio de conectores de 8 pinos ou 12VHPWR. As plataformas compatíveis confirmadas incluem Dell PowerEdge R760xa, R770 (até 6x L40S), R7715, xFusion G5500 V7, 2288H V7, e 2488H V7. Requer fluxo de ar adequado no chassi — o design de resfriamento passivo depende dos perfis de velocidade do ventilador do servidor. Verifique se o kit de ativação de GPU do seu servidor inclui os cabos de alimentação corretos antes de fazer o pedido.
Fonte através de Xincuan
Fornecemos GPUs L40S pré-instaladas em servidores Dell PowerEdge e xFusion, ou como atualizações independentes para plataformas existentes. Preços direto da fábrica, 3-ano de garantia, e envio global. Nossos engenheiros de infraestrutura de IA podem ajudá-lo a dimensionar corretamente sua frota de GPU – cluster de treinamento versus cluster de inferência versus carga de trabalho mista – para maximizar o rendimento por dólar.
Servidor Xinchuan | Fornecedor de hardware de servidor empresarial











