모든 AI 인프라 회의에서 일어나는 대화
IT 이사: “추론을 위해서는 GPU가 필요합니다. 엔지니어링에서는 H100을 원합니다.”
인프라 설계자: “미세 조정된 7B 모델을 제공하려면 80GB의 HBM3 및 FP8 Transformer Engine이 필요합니까??”
IT 이사: “…그들은 H100이라고 말했습니다.”
인프라 설계자: “L40S가 필요해. 전력 예산의 절반, 30% 비용의, 힘들이지 않고 추론 작업량을 처리합니다.. 실제로 중요한 교육 클러스터에 H100 예산을 지출하겠습니다.”
이 대화는 GPU 시장이 훈련용 GPU와 추론 GPU로 명확하게 구분되어 있기 때문에 발생합니다. 그리고 이 둘을 혼동하는 것이 AI 인프라에 과도한 비용을 지출하는 가장 빠른 방법입니다.. NVIDIA L40S는 추론의 도구입니다: 48 ECC가 포함된 GB GDDR6, PCIe Gen4 x16, 표준 공냉식 서버에 맞는 듀얼 슬롯 폼 팩터의 300W TDP.
기술 사양
| 매개변수 | 사양 |
|---|---|
| GPU 아키텍처 | 엔비디아 에이다 러브레이스 |
| 쿠다 색상 | 18,176 |
| 텐서 코어 | 568 (4세대) |
| RT 코어 | 142 (33세대) |
| 메모리 | 48 ECC가 포함된 GB GDDR6 |
| 메모리 대역폭 | 864 GB/초 |
| 메모리 버스 | 384-조금 |
| 인터페이스 | PCIe 4.0 x16 |
| FP32 성능 (비텐서) | 91.6 테플롭스 |
| TF32 텐서 코어 | 183 테플롭스 (희박하게: 366 테플롭스) |
| FP16 텐서 코어 | 362 테플롭스 (희박하게: 733 테플롭스) |
| INT8 텐서 코어 | 733 탑 (희박하게: 1,466 탑) |
| FP8 텐서 코어 | 733 테플롭스 (희박하게: 1,466 테플롭스) |
| TDP (최대) | 300승 |
| 폼 팩터 | 듀얼 슬롯, 전체 높이, 전체 길이 (FHFL), 수동 냉각 |
| 전원 커넥터 | 1x PCIe CEM 16핀 (12VHPER) 또는 1x 8핀 CPU 전원 |
| NV링크 / NV스위치 | 지원되지 않습니다 (단일 GPU 추론, 다중 GPU 패브릭 없음) |
| 나 (멀티 인스턴스 GPU) | 지원되지 않습니다 (MIG 워크로드에는 A100 또는 H100을 사용하세요.) |
| vGPU 지원 | 엔비디아 vWS, vPC, vApp — VDI 및 가상화 지원 |
| ECC 메모리 | GDDR6의 전체 ECC (모든 GDDR6 GPU가 ECC를 제공하는 것은 아닙니다. L40S는 ECC를 제공합니다.) |
| 물리적 크기 | 267 엑스 112 mm (듀얼 슬롯), 1.35 킬로그램 |
| 작동 온도 | 0° C ~ 45 ° C |
| 보증 | 3-년도 (제조업체) |
L40S vs H100 vs A100 — 작업 부하에 적합한 GPU?
| 작업량 | L40S | A100 80GB | H100 80GB |
|---|---|---|---|
| LLM 추론 (7B-13B 모델, FP16) | 훌륭한. 48GB는 대부분의 13B 모델에 적합. | 여러 모델을 동시에 실행하지 않는 한 과잉. | 과잉. FP8 추론은 더 빠르지만 이 규모에서는 필요하지 않습니다.. |
| LLM 추론 (70B+ 모델) | 투쟁. 48양자화 없는 70B 모델에는 GB가 부족함. | INT8 양자화에 적합. 80GB는 70B 모델에 적합. | 최상의. FP8 + 최대 처리량을 위한 Transformer Engine. |
| 전체 모델 학습 (70B+) | 권장되지 않음. NVLink 없음, 제한된 메모리. | 미세 조정에 적합. 전체 교육에는 NVLink가 필요합니다.. | 최상의. NV스위치 + 다중 GPU 훈련을 위한 HBM3. |
| 미세 조정 (로라, QLoRA, 7B-13B) | 훌륭한. 48GB + FP16이면 충분합니다. | 좋은데 필요한 것보다 비싸요. | 과잉. 더 많은 L40S 장치에 절감액을 투자하세요. |
| VDI / 가상 데스크탑 | 훌륭한. vGPU + 48GB 지원 6-12 동시 사용자. | 좋지만 사용자당 비용이 많이 듭니다.. | VDI 워크로드용으로 설계되지 않음. |
| 표현 / RTX 워크로드 | 훌륭한. RT 코어 + 18K CUDA 색상. | RT 코어 없음. 렌더링용으로 설계되지 않음. | RT 코어 없음. |
| HPC 시뮬레이션 (FP64) | 권장되지 않음. FP64 Tensor 코어 없음. | 좋은. FP64 Tensor 코어 활성화됨. | A100에 비해 제한된 FP64. |
| 가격 (H100 대비) | ~25-30% | ~55-65% | 100% (기준선) |
호환되는 서버 플랫폼
L40S는 PCIe입니다. 4.0 8핀 또는 12VHPWR 커넥터를 통해 300W GPU 전원 공급을 지원하는 모든 서버와 호환되는 x16 듀얼 슬롯 FHFL 카드. 확인된 호환 플랫폼에는 Dell PowerEdge R760xa가 포함됩니다., R770 (L40S 최대 6개), R7715, xFusion G5500 V7, 2288H V7, 그리고 2488H V7. 적절한 섀시 공기 흐름이 필요합니다. 수동 냉각 설계는 서버 팬 속도 프로필에 따라 달라집니다.. 주문하기 전에 서버의 GPU 활성화 키트에 올바른 전원 케이블이 포함되어 있는지 확인하세요..
Xicuan을 통한 소스
Dell PowerEdge 및 xFusion 서버에 사전 설치된 L40S GPU를 제공합니다., 또는 기존 플랫폼에 대한 독립형 업그레이드로. 공장 직접 가격, 3-1년 보증, 그리고 글로벌 배송. 당사의 AI 인프라 엔지니어는 훈련 클러스터, 추론 클러스터, 혼합 워크로드 등 GPU 제품군의 크기를 적절하게 조정하여 달러당 처리량을 극대화하도록 도와드립니다..
Xinchuan 서버 | 엔터프라이즈 서버 하드웨어 공급업체











