NVIDIA L40S 48GB | GPU de data center para inferência de IA & Gráficos - Servidor Xinchuan | Fornecedor de hardware de servidor empresarial

Você tem um servidor/

NVIDIA L40S 48GB | GPU de data center para inferência de IA & Gráficos

A conversa que acontece em cada reunião de infraestrutura de IADiretor de TI: "Precisamos de GPUs para inferência. A engenharia quer H100s."Arquiteto de Infraestrutura: "Eles precisam de 80 GB de HBM3 e FP8 Transformer Engine para servir um modelo 7B ajustado??"Diretor de TI: "…Eles disseram H100."Arquiteto de Infraestrutura: "Eles precisam de um L40S. Metade do orçamento de energia, 30% do custo, e ele lida com a carga de trabalho de inferência sem suar a camisa. Vamos gastar o orçamento do H100 no cluster de formação onde realmente importa."Essa conversa acontece porque o mercado de GPU se segmenta claramente em GPUs de treinamento e GPUs de inferência – e confundir os dois é a maneira mais rápida de gastar demais em infraestrutura de IA. O NVIDIA L40S é o carro-chefe da inferência: 48 GB GDDR6 com ECC, PCIe Gen4 x16, e…

  • Detalhes do produto

A conversa que acontece em todas as reuniões de infraestrutura de IA

Diretor de TI: “Precisamos de GPUs para inferência. A engenharia quer H100s.”

Arquiteto de Infraestrutura: “Eles precisam de 80 GB de HBM3 e FP8 Transformer Engine para servir um modelo 7B ajustado??”

Diretor de TI: “…Eles disseram H100.”

Arquiteto de Infraestrutura: “Eles precisam de um L40S. Metade do orçamento de energia, 30% do custo, e ele lida com a carga de trabalho de inferência sem suar a camisa. Vamos gastar o orçamento do H100 no cluster de formação onde realmente importa.”

Essa conversa acontece porque o mercado de GPU se segmenta claramente em GPUs de treinamento e GPUs de inferência – e confundir os dois é a maneira mais rápida de gastar demais em infraestrutura de IA. O NVIDIA L40S é o carro-chefe da inferência: 48 GB GDDR6 com ECC, PCIe Gen4 x16, e TDP de 300 W em um formato de slot duplo que cabe em servidores padrão refrigerados a ar.

Especificações técnicas

Parâmetro Especificação
Arquitetura GPU NVIDIA Ada Lovelace
CUDA Cores 18,176
Núcleos tensoriais 568 (4ª geração)
Núcleos RT 142 (3Terceira Geração)
Memória 48 GB GDDR6 com ECC
Largura de banda de memória 864 GB/s
Barramento de memória 384-pedaço
Interface PCIe 4.0 x16
Desempenho FP32 (não Tensor) 91.6 TFLOPS
Núcleo Tensor TF32 183 TFLOPS (com escassez: 366 TFLOPS)
Núcleo Tensor FP16 362 TFLOPS (com escassez: 733 TFLOPS)
Núcleo Tensor INT8 733 TOPOS (com escassez: 1,466 TOPOS)
Núcleo Tensor FP8 733 TFLOPS (com escassez: 1,466 TFLOPS)
TDP (máx.) 300C
Fator de forma Slot duplo, altura total, comprimento total (FHFL), resfriamento passivo
Conector de alimentação 1x PCIe CEM de 16 pinos (12VHPER) ou 1x alimentação de CPU de 8 pinos
NVLink / NVSwitch Não compatível (inferência de GPU única, sem estrutura multi-GPU)
MEU (GPU multi-instância) Não compatível (use A100 ou H100 para cargas de trabalho MIG)
Suporte para vGPU NVIDIA vWS, vPC, vApps — compatível com VDI e virtualização
Memória ECC ECC completo em GDDR6 (nem todas as GPUs GDDR6 oferecem ECC – o L40S oferece)
Dimensões Físicas 267 x 112 milímetros (slot duplo), 1.35 kg
Temperatura operacional 0°C a 45 °C
Garantia 3-ano (fabricante)

L40S vs H100 vs A100 – Qual GPU para sua carga de trabalho?

Carga de trabalho L40S A100 80GB H100 80GB
Inferência LLM (7Modelos B-13B, FP16) Excelente. 48GB cabe na maioria dos modelos 13B. Exagero, a menos que execute vários modelos simultaneamente. Exagero. A inferência do FP8 é mais rápida, mas não é necessária nesta escala.
Inferência LLM (70Modelos B+) Lutas. 48GB insuficiente para modelos 70B sem quantização. Bom com quantização INT8. 80GB cabe em modelos 70B. Melhor. 8º PQ + Transformer Engine para rendimento máximo.
Treinamento completo do modelo (70B+) Não recomendado. Sem NVLink, memória limitada. Aceitável para ajuste fino. Necessidades completas de treinamento NVLink. Melhor. NVSwitch + HBM3 para treinamento multi-GPU.
Afinação (LoRA, QLoRA, 7B-13B) Excelente. 48GB + FP16 é suficiente. Bom, mas mais caro do que o necessário. Exagero. Gaste as economias em mais unidades L40S.
VDI / Áreas de trabalho virtuais Excelente. vGPU + 48GB suporta 6-12 usuários simultâneos. Bom, mas caro por usuário. Não projetado para cargas de trabalho VDI.
Renderização / Cargas de trabalho RTX Excelente. Núcleos RT + 18K CUDA cores. Sem núcleos RT. Não projetado para renderização. Sem núcleos RT.
Simulação de HPC (FP64) Não recomendado. Sem núcleos tensores FP64. Bom. Núcleos tensores FP64 habilitados. FP64 limitado em comparação com A100.
Preço (em relação a H100) ~25-30% ~55-65% 100% (linha de base)

Plataformas de servidor compatíveis

O L40S é um PCIe 4.0 Placa FHFL x16 de slot duplo compatível com qualquer servidor que suporte fornecimento de energia de GPU de 300 W por meio de conectores de 8 pinos ou 12VHPWR. As plataformas compatíveis confirmadas incluem Dell PowerEdge R760xa, R770 (até 6x L40S), R7715, xFusion G5500 V7, 2288H V7, e 2488H V7. Requer fluxo de ar adequado no chassi — o design de resfriamento passivo depende dos perfis de velocidade do ventilador do servidor. Verifique se o kit de ativação de GPU do seu servidor inclui os cabos de alimentação corretos antes de fazer o pedido.

Fonte através de Xincuan

Fornecemos GPUs L40S pré-instaladas em servidores Dell PowerEdge e xFusion, ou como atualizações independentes para plataformas existentes. Preços direto da fábrica, 3-ano de garantia, e envio global. Nossos engenheiros de infraestrutura de IA podem ajudá-lo a dimensionar corretamente sua frota de GPU – cluster de treinamento versus cluster de inferência versus carga de trabalho mista – para maximizar o rendimento por dólar.

Solicite uma configuração e orçamento do L40S

Anterior:

Próximo:

Deixe uma resposta

Telefone

LinkedIn LinkedIn

Skype

Whatsapp

Código QR do WeChat WeChat

E-mail

WeChat

WeChat QR Code

Escaneie o código QR com o WeChat