2029년 까지 AI 로드맵을 공개한 화웨이 - 2029년까지 28 PFLOPS FP4?

  (출처: 화웨이) ​ 미국의 제재에도 불구하고 빠른 속도로 성장하고 있는 중국 AI의 가장 큰 약점은 바로 뒷받침해 줄 하드웨어가 부족하다는 것입니다. 딥시크의 경우 확보한 연산 자원이 구형 엔비디아 후퍼 계열 GPU 1-5만 장 사이로 알려져 있어 연산 효율을 극도로 높인 모델을 개발했습니다. 현재 화웨이 어센드 950도 일부 도입한 상태이긴 하나 어센드 4장이 GB 300 한 장 정도의 성능을 지닌 것으로 알려져 있습니다. 아직은 성능이 낮다는 이야기입니다. ​ 이전 포스트: https://blog.naver.com/jjy0501/224358988848 ​ 아무튼 화웨이 역시 공격적인 로드맵을 발표하면서 연산 자원 확보가 급한 중국 AI 기업들에 공급할 준비를 하고 있습니다. 최근 화웨이는 화웨이 커넥트 2026 행사에서 차세대 어센드(Ascend) NPU와 클러스터인 아틀라스(Atlas) 슈퍼포드 (SuperPod) 로드맵을 발표했는데, 여기에는 Ascend 960DT/PR, Ascend 970, Ascend 980와 이를 지원하는 여러 신기술이 포함됩니다. ​ 우선 화웨이는 내년에 어센드 950 칩의 후속 제품인 차세대 어센드 960DT를 선보일 예정입니다. 이 칩은 새로운 SIMD/SIMT 아키텍처를 채택하여 FP32, HF32, FP16, BF16, FP8, MXFP8, HiF8, MXFP4 등 다양한 데이터 포맷을 지원합니다. 특히 "H" 포맷은 정밀도와 동적 범위를 모두 고려하여 표준 부동 소수점 데이터 포맷 두 가지를 하나의 포맷으로 대체할 수 있습니다. HiF8은 화웨이의 독자 데이터 포맷으로 어센드 칩에서 성능을 높일 수 있습니다. ​ 어센드 960DT 최대 2 PFLOPs의 FP8 연산 능력과 4 PFLOPs의 FP4 연산 능력을 갖출 예정입니다. 참고로 엔비디아 GB300의 경우 FP4 기준 최대 20 PFLOPs에 달하고 베라 루빈은 최대 50 PLFOPs에 달해 성능 면에서는 엔비디아의 압승이라고 할 ...
최근 글