Skip to content
vsMars
용어집

Tensor 코어

딥러닝에 쓰이는 반정밀도 연산에 최적화된 NVIDIA RTX GPU의 특수 행렬 곱셈 유닛. DLSS, 프레임 생성, 온디바이스 AI 추론을 구동한다.

Tensor 코어는 작은 행렬(보통 4×4 FP16/BF16/INT8)에 대해 융합 곱셈-누산 연산을 CUDA 코어가 할 수 있는 것보다 훨씬 빠르게 실행한다. 아키텍처적 성과: 소비자 카드에서 수백 TOPS.

무엇이 사용하나

  • DLSS — 신경망 업스케일링과 프레임 생성.
  • NVIDIA Broadcast — 배경 흐림, 노이즈 제거.
  • 로컬 LLM — Llama, Mistral 추론을 쓸 만한 속도로.
  • Stable Diffusion — CUDA 전용보다 5~10배 빠른 이미지 생성.

세대

  • Turing — 1세대.
  • Ampere — 3세대, 희소성 추가.
  • Ada — 4세대, FP8 추가.
  • Blackwell — 5세대, FP4 추가 및 훨씬 높은 처리량.
어디서 중요한가

Categories that use tensor 코어

계속 읽기

Other terms you might need