AI 모델 경쟁, 최신 GPU를 도입하는 것만으로 충분할까? 최신 GPU인 NVIDIA Blackwell(B200)을 투입하는 것만으로 성능을 효과적으로 끌어낼 수 있을까요? 아쉽게도 그렇지 않습니다. GPU 연산 소프트웨어가 GPU의 발전 속도에 맞춰 함께 새로 작성되어야만 가속기의 성능을 온전히 끌어낼 수 있습니다. Self-attention 연산 가속 프레임워크인 FlashAttention(FA)이 Ampere용 FA2에서 Hopper용 FA3, 그리고 Blackwell용 FA4로 지속적으로 커널 구조를 발전시켜 온 […]