용어집
Tensor 코어
딥러닝에 쓰이는 반정밀도 연산에 최적화된 NVIDIA RTX GPU의 특수 행렬 곱셈 유닛. DLSS, 프레임 생성, 온디바이스 AI 추론을 구동한다.
Tensor 코어는 작은 행렬(보통 4×4 FP16/BF16/INT8)에 대해 융합 곱셈-누산 연산을 CUDA 코어가 할 수 있는 것보다 훨씬 빠르게 실행한다. 아키텍처적 성과: 소비자 카드에서 수백 TOPS.
무엇이 사용하나
- DLSS — 신경망 업스케일링과 프레임 생성.
- NVIDIA Broadcast — 배경 흐림, 노이즈 제거.
- 로컬 LLM — Llama, Mistral 추론을 쓸 만한 속도로.
- Stable Diffusion — CUDA 전용보다 5~10배 빠른 이미지 생성.
세대
- Turing — 1세대.
- Ampere — 3세대, 희소성 추가.
- Ada — 4세대, FP8 추가.
- Blackwell — 5세대, FP4 추가 및 훨씬 높은 처리량.
어디서 중요한가
Categories that use tensor 코어
계속 읽기