기본 콘텐츠로 건너뛰기

헬리오스 AI 랙 시스템을 공개한 AMD






 (출처: AMD)

AMD가 정식 출시를 앞두고 AI 랙 시스템인 헬리오스 (Helios)에 대한 세부 정보를 공개했습니다. 헬리오스 AI 랙은 Advancing AI 2026 행사에서 공식 출시될 예정이빈다. 헬리오스 AI 랙은 세 가지 핵심 구성 요소로 이루어져 있습니다.

AMD 인스팅트 MI455X GPU

6세대 AMD EPYC CPU

AMD Pensando AI NIC

해당 시스템에 대해 AMD는 CNBC 인터뷰에서 자세히 공개했습니다.

AMD Instinct MI400 시리즈는 헬리오스 랙 한 개의 72개가 탑재됩니다. 이 GPU는 최신 CDNA 5 아키텍처를 기반으로 432GB HBM4 메모리를 탑재하고 있습니다. 여기에는 몇 가지 제품이 있는데 우선 Instinct MI455X와 MI450X 는 대규모 AI 학습 및 추론 워크로드에 최적화되어 있습니다. 이중 MI455X가 헬리오스 랙에 탑재됩니다. 세 번째 칩인 MI430X 는 HPC 및 Sovereign AI 워크로드를 대상으로 하며, 최고 성능의 FP64 처리 능력, 하이브리드 컴퓨팅(CPU+GPU), 그리고 MI455X와 동일한 HBM4 메모리를 특징으로 합니다.

AMD Instinct MI455X는 FP4 연산에서 40 PFLOPs, FP8 연산에서 20 PFLOPs의 성능을 제공하며, 이는 MI350 시리즈의 두 배에 달하는 성능입니다. 참고로 엔비디아 루빈 (Rubin) GPU는 FP4 연산에서 50 PFLOPs, FP8 연산에서 17.5 PFLOPs의 성능을 제공합니다. 그리고 HBM4 표준은 MI350 시리즈의 8TB/s보다 두 배 이상 빠른 19.6TB/s의 대역폭을 제공합니다. 참고로 루빈 GPU는 22TB/s의 대역폭을 제공하는 288GB HBM4를 탑재하고 있습니다.

AMD Instinct AI Accelerators:

Accelerator Name

AMD Instinct MI400

AMD Instinct MI350X

AMD Instinct MI325X

AMD Instinct MI300X

AMD Instinct MI250X

GPU Architecture

CDNA 5

CDNA 4

Aqua Vanjaram (CDNA 3)

Aqua Vanjaram (CDNA 3)

Aldebaran (CDNA 2)

GPU Process Node

2nm+3nm

3nm

5nm+6nm

5nm+6nm

6nm

XCDs (Chiplets)

8 (MCM)

8 (MCM)

8 (MCM)

8 (MCM)

2 (MCM)

1 (Per Die)

GPU Cores

TBD

16,384

19,456

19,456

14,080

GPU Clock Speed (Max)

TBD

2400 MHz

2100 MHz

2100 MHz

1700 MHz

INT8 Compute

TBD

5200 TOPS

2614 TOPS

2614 TOPS

383 TOPs

FP6/FP4 Matrix

40 PFLOPs

20 PFLOPs

N/A

N/A

N/A

FP8 Matrix

20 PFLOPs

5 PFLOPs

2.6 PFLOPs

2.6 PFLOPs

N/A

FP16 Matrix

10 PFLOPs

2.5 PFLOPs

1.3 PFLOPs

1.3 PFLOPs

383 TFLOPs

FP32 Vector

TBD

157.3 TFLOPs

163.4 TFLOPs

163.4 TFLOPs

95.7 TFLOPs

MI400 시리즈 GPU와 함께 또 다른 핵심 구성 성분은 6세대 에픽 CPU인 베니스 (EPYC Venice)입니다. TSMC의 2nm 공정 기술으로 양산된 첫 CPU로 FinFET에서 나노시트 트랜지스터(GAA)로 전환되어 동일 전력에서 10~15% 더 높은 성능, 동일 성능에서 25~30% 더 낮은 전력 소비, 그리고 최대 15% 더 높은 트랜지스터 밀도를 제공합니다.

베니스는 최대 256개의 코어와 512개의 스레드를 제공하고, 8개의 대형 컴퓨팅 다이와 2개의 더욱 큰 I/O 다이를 탑재했습니다. AMD는 베니스를 통해 EPYC CPU의 성능과 효율성이 70% 이상 향상되고, 스레드 밀도도 30% 이상 증가했다고 밝혔습니다. 에이전트 기반 AI 워크로드의 등장으로 고성능 CPU에 대한 요구 사항이 크게 증가한 상황에서 베니스의 양산은 AMD에게 큰 무기가 될 수 있습니다. 에픽 CPU는 랙 당 18개가 장착됩니다.

그리고 헬리오스에는 엔비디아의 ConnectX-8 및 Bluefield 3/4 DPU에 필적하는 최신 Vulcano 800 AI NIC 및 Salina DPU가 탑재되어 있습니다. AMD Pensando "Vulcano" 800 AI NIC는 800Gbps의 고성능 스위치로, 800Gbps 이더넷 네트워크 처리량을 제공합니다. 현재 GPU당 최대 2.4Tbps의 스케일아웃 대역폭을 제공하는 유일한 NIC이며, 하드웨어 및 소프트웨어 프로그래밍 기능을 완벽하게 지원합니다.

각 GPU는 최대 8배의 스케일아웃 대역폭을 활용할 수 있으며, UAL/PCIe Gen6 호스트 인터페이스를 통해 GPU 간 초저지연 통신을 구현합니다. 또한 Vulcano는 대규모 AI 클러스터에 최적화된 RDMA 이더넷을 지원하며 UEC(Unified Enhancement Code)를 지원합니다. 복잡한 이야기이지만, 결론적으로 고성능 네트워킹이 뒷받침되어야 거대한 랙 시스템도 의미가 있다는 이야기입니다.

헬리오스 AI Rack은 메타가 OCP(Open Compute Project)에 제출한 Open Rack Wide 표준을 활용합니다. 헬리오스 랙은 18개의 컴퓨팅 트레이와 6개의 스위치로 구성된 완전 수랭식 설계이며, 각 트레이에는 4개의 Instinct MI455X GPU와 1개의 EPYC Venice "Zen 6" CPU가 탑재되어 있습니다. 이 시스템은 네트워킹 및 상호 연결을 위해 AMD Pensando "Salina" 400 DPU와 Pensando "Vulcano" 800 AI NIC를 사용합니다. 각 GPU는 구리로 제작된 액체 냉각판 아래에 배치됩니다. 헬리오스 AI 랙 전체의 무게는 약 2,267kg이며 가격은 500만~550만 달러 정도입니다 . 각 랙은 약 225~245kW의 전력을 소비합니다.

헬리오스 AI 랙은 최대 2.9 엑사플롭스의 FP4 컴퓨팅 성능, 1.4 엑사플롭스의 FP8 컴퓨팅 성능, 31TB의 HBM4 메모리, 1.4PB/s의 총 대역폭, 43TB/s의 스케일아웃 대역폭, 260TB/s의 스케일업 인터커넥트 대역폭, 그리고 최대 4,600개의 CPU 코어와 18,000개의 GPU 코어를 지원합니다. 이러한 모든 기능을 통해 수조 개의 파라미터를 가진 모델 학습과 대규모 AI 추론이 가능합니다.

특징

AMD 헬리오스

NVIDIA Vera Rubin NVL72(Oberon)

랙당 GPU 개수

72 × AMD Instinct MI455X (CDNA 5 아키텍처)

72 × NVIDIA 루빈

GPU 메모리(GPU당)

432GB HBM4

288GB HBM4

총 GPU 메모리

31TB HBM4

20.7TB HBM4

GPU 메모리 대역폭(GPU당)

19.6 TB/s

22TB/s

총 GPU 메모리 대역폭

약 1,411 TB/s (계산값)

1,580 TB/s

최고 AI 성능(랙)

2.9 EFLOPS (MXFP4/FP4) 1.4 EFLOPS (MXFP8/FP8)

추론 성능 3.6 EFLOPS NVFP4, 학습 성능 2.52 EFLOPS NVFP4

랙당 CPU 개수

18 × 6세대 AMD EPYC (Zen 6 / "Venice") (CPU 도메인: CPU당 최대 256개 코어)

36개의 NVIDIA Vera(맞춤형 Arm Olympus 코어)로 총 3,168개의 코어(CPU당 88개 코어)를 제공합니다.

규모 확장형 상호 연결

260TB/s (UALink over Ethernet / UALoE)

260TB/s (NVLink 6)

스케일아웃 네트워킹

43TB/s (Ultra Ethernet Consortium 인증, AMD Pensando Vulcano 800G AI NIC + Salina DPU 탑재)

28.8TB/s (Spectrum-X 이더넷, ConnectX-9 SuperNIC + BlueField-4 DPU)

냉각

액체 냉각 방식 (랙 장착 가능, 퀵 커넥터가 있는 매니폴드 포함)

액체 냉각 방식 (NVIDIA MGX 모듈형, 케이블 없는 트레이 디자인)

소프트웨어 생태계

AMD ROCm(오픈 소스), PyTorch, JAX, ONNX, vLLM, Triton 네이티브 지원; Day-0 모델 지원; 다양한 벤더 간 상호 운용성

NVIDIA CUDA + 풀 스택(AI 엔터프라이즈, 미션 컨트롤 등)을 아우르는 지배적인 생태계

표준 및 개방성

개방형(OCP Open Rack Wide, UEC, 개방형 하드웨어/소프트웨어 표준) 설계로 유연성을 높이고 벤더 종속성을 줄였습니다.

NVIDIA 중심의 광범위한 파트너 생태계(MGX)를 갖추고 있으며, 독점 요소(예: NVLink)를 포함하지만 고도로 최적화되어 있습니다.

핵심 차별화 요소

더 높은 HBM4 총 용량(대규모 모델/컨텍스트에 더 적합); 더 높은 스케일아웃 대역폭; 혁신과 선택을 위한 개방형 생태계

저정밀도 포맷에서 더 높은 최대 FLOPS 성능; 강력한 효율성 (예: 이전 세대 대비 토큰당 추론 비용 약 10배 절감); 성숙한 소프트웨어 및 네트워크 내 컴퓨팅 기능

상태/일정

참조 설계(파트너와 공유); 대량 배포는 2026년 하반기로 예상됩니다.

본격적인 생산 단계로 진입 중이며, 2026년 배포를 목표로 하고 있습니다.

다만 현재 AI GPU이 생태계는 엔비디아의 CUDA가 표준으로 AMD의 시장 점유율은 4.5%에 불과합니다. 헬리오스 AI 랙 시스템이 시장 점유율을 의미 있게 끌어올릴 수 있는 계기가 될 수 있을지 주목됩니다.

참고

https://wccftech.com/amd-helios-ai-rack-mi455x-6th-gen-epyc-challenging-nvidia/

댓글

이 블로그의 인기 게시물

벨 V-280 Valor 시험 비행 성공

( The V-280 Valor flew for the first time at Bell Helicopter's Amarillo Assembly Center in Texas(Credit: Bell Helicopter/YouTube) )  앞서 소개드린 V-280 발러가 첫 번째 비행 테스트에 성공했다는 소식입니다. V-22 오스프리의 소형화 버전이라고 할 수 있는 V-280 발러는  미 육군의 차세대 헬기 사업인 Future Vertical Lift (FVL)에 입찰을 시도하는 틸트로터기로 현재 미 육군이 주력으로 사용하는 블랙호크 헬기와 비슷한 체급입니다. 다만 틸트로터기인 만큼 최고 속도나 항속 거리면에서 더 유리합니다. 스펙은 이전 포스트를 참조해 주시기   이전 포스트:  https://blog.naver.com/jjy0501/221115245986  (동영상)   V-280 발러는 틸트로터기의 더 대중화 될 수 있을지를 검증하는 중요한 무대가 될 것입니다. V-22 오스프리의 경우 복잡한 구조로 인해 가격이 너무 비싸져서 사실 미국은 몰라도 그 동맹국에 널리 도입되기는 어려운 부분이 있습니다. V-280 역시 가격이 아주 저렴할 것 같지는 않지만, 좀 더 합리적인 대안은 될 수 있을 것 같습니다. 만약 성공적인 결과가 나오면 한국을 포함한 미국의 동맹국에서 도입을 검토할 수 있을지 모르겠다는 생각입니다.   참고  https://newatlas.com/bell-v-280-valor-maiden-flight/52663/

100 테슬라급 자기장 도달

 미국의 로스 알라모스 국립 연구소 (Los Alamos National Laboratory) 에서 과학자들이 지금까지 인간이 개발한 가장 강력한 자기장을 발생시키는 장치 개발에 도전하고 있습니다. 자기장의 세기를 나타내는 방법으로 자기력선의 밀도를 나타내기 위해 단위 면적당 자기력선의 수를 표시하는 단위인 테슬라 (T) 가 있습니다. (1T = 1Wb/㎡  웨버 (Wb) 는 자속의 단위)   의료용으로 사용되는 초전도체를 이용한 MRI 의 경우 1.5 - 3 테슬라급의 강력한 자기장으로 인체 내부를 볼 수 있게 만들지만 과학 연구용으로 이보다 더 강력한 자기장이 필요할 수 있습니다. 최근에 등장한 90 테슬라급 자기장에 이어 이번에 로스 알라모스 국립 연구소에서는 100 테슬라급인 100.75 T 를 실현 했다고 합니다.   이를 구현한 것은 18000 파운드 (8.16 톤 정도) 의 코일과 여기에 에너지를 공급할 1200 메가줄 (Megajoule) 급 모터 제네레이터등의 설비입니다.  (   The 1,200-megajoule motor generator that powers the magnetic pulse.  )  이와 같은 연구를 통해 알아내고자 하는 것은  Quantum Phase transitions and new ultra high field magnetic states Electronic Structure determination Topologically protected states of matter  로 요약할 수 있다고 합니다.   아무튼 수 T 급 MRI 만 해도 자기장의 힘이 엄청난데 100 T 라니 엄청난 자기장이네요. 이는 지구 자기장 세기보다 200만배 강력한 (물론 좁은 범위에서 작용하는 자기장이라 지구 전체...

고대 양서류 이야기 (2) - 악어를 닮은 거대 양서류들

  페름기에는 다양한 양막류가 진화해서 앞서 소개한 육상형 템노스폰딜리는 점차 설 자리를 잃게 됩니다. 하지만 양서류는 본래 자신의 서식지인 물과 습지에서 여전히 번성을 누렸습니다. 당시에는 악어류 같은 대형 양서형 파충류도 없던 시절이었기 때문에 이와 비슷한 생태학적 지위는 여전히 양서류의 몫이었습니다. 이들에 대한 이야기는 제 책인 포식자에서 비교적 간단히 다뤘는데, 오늘은 여기에 대한 보충 설명입니다.  책 정보:  http://book.naver.com/bookdb/book_detail.nhn?bid=13347200 Yes 24:  http://www.yes24.com/24/goods/58772859 11번가:  http://books.11st.co.kr/product/SellerProductDetail.tmall?method=getSellerProductDetail&prdNo=1977867160 알라딘:  http://www.aladin.co.kr/shop/wproduct.aspx?ItemId=134877825 교보문고:  http://www.kyobobook.co.kr/product/detailViewKor.laf?ejkGb=KOR&mallGb=KOR&barcode=9788970447988&orderClick=LAG&Kc= 인터파크 :  http://book.interpark.com/product/BookDisplay.do?_method=detail&sc.prdNo=279593764&sc.saNo=003002003&bid1=search_auto&bid2=detail&bid3=prd_img&bid4=001 영풍문고:  http://www.ypbooks.co.kr/book.yp?bookcd=100843205&gubun=NV ...