기본 콘텐츠로 건너뛰기

알리바바 XuanTie C950 - Qwen 3.8 27B를 돌리는 RISC-V 컴퓨터





 (출처: 알리바바)

알리바바는 2026년 3월, 엣지 AI용 RISC-V 기반 칩인 쉬안테 (XuanTie) C950을 공개했습니다. 일반적인 ASIC과 달리 쉬안테 C950은 AI 워크로드 처리에 GPU를 사용하지 않습니다. 대신 고성능 64비트 RISC-V 코어 64개를 집적한 프로세서로 클럭 주파수는 최대 3.20GHz까지 작동합니다. 아키텍처를 보면 클러스터당 8개의 코어로 구성된 여러 클러스터가 고속 AMBA CHI 패브릭을 사용하여 네이티브 방식으로 연결됩니다.

AI 생성 정리 (그록)

XuanTie C950 아키텍처와 메모리 서브시스템에 대한 상세 정보를 정리했습니다. (공식 데이터시트·발표 자료·기술 기사 기반)

1. 기본 아키텍처 개요

  • ISA: RISC-V RVA23 (RVA23.1 포함) 프로필 완전 지원

  • 필수 확장 + 거의 모든 선택 확장 지원 (Vector Crypto, Zacas, Zama16b, Smmtt, CoVE, AIA, RAS 등)

  • 마이크로아키텍처:

  • 64비트 슈퍼스칼라 아웃오브오더(Out-of-Order)

  • 8-wide decode (한 번에 8개 명령어 디코드)

  • 16-stage 파이프라인

  • 아웃오브오더 윈도우: 1,000개 이상 명령어

  • TAGE 기반 고급 분기 예측 + 하드웨어 지능형 데이터 프리페치

  • 클럭: 최대 3.2 GHz

  • 성능: SPECint2006 단핵 70점 이상 (약 22+/GHz) → RISC-V 역대 최고 수준

  • 공정: 5nm (TSMC로 추정, 공식 확인은 없음)

  • 클러스터 구성: 클러스터당 최대 8코어, 여러 클러스터를 연결해 최대 64코어 구성 가능

  • 클러스터 내부: 고속 AMBA CHI (CHI.E / CHI.F) 패브릭으로 연결

2. 메모리 서브시스템 (캐시 & MMU) — 핵심 부분

계층

구성

상세 스펙

L1 캐시

코어당 프라이빗

- 데이터 캐시: 64KB, 4-way set-associative - Load-to-use 지연: 4사이클 (매우 낮음) - 명령어 캐시도 일반적으로 64KB 수준

L2 캐시

코어당 프라이빗

- 용량 선택 가능: 256KB / 512KB / 1MB / 2MB / 3MB - ECC 지원 옵션

L3 캐시

클러스터/공유 (옵션)

- 용량 선택 가능: 0 / 1 / 2 / 3 / 4 / 6 / 8 / 12 / 16 / 24 / 32MB - 고대역폭 분산형 설계로 코어 간 통신 병목 완화

MMU

-

- 지원 모드: Sv39 / Sv48 / Sv57 - 물리 주소: PA48 - 2단계 주소 변환 지원 지원 (가상화에 유리)

  • 메모리 모델: AVWMO / TSO를 동적으로 전환 가능

  • 프리페치: 하드웨어 레벨 지능형 데이터 프리페칭으로 메모리 스트링을 미리 캐시에 로드

  • 대역폭: 이전 세대(C920) 대비 메모리 대역폭 4배 이상 향상 주장

이 캐시 계층 구조가 LLM 추론에서 중요한 역할을 합니다. 낮은 L1 지연 + 큰 프라이빗 L2 + 유연한 L3 조합으로 가중치와 활성화 값을 효율적으로 재사용합니다.

3. AI 가속 (메모리와 밀접한 부분)

  • XuanTie TPE (Tensor Processing Engine): AME (Attached Matrix Extension)를 통해 코어에 긴밀히 통합

  • 단 TPE당 최대 8 TOPS

  • 지원 데이터 타입: INT4/INT8, FP8, MXFP8, MXFP4, RVFP4, FP16, BF16 등

  • Matrix 엔진 + Vector 엔진 병렬 실행 가능 (Softmax, SiLU, GELU 등 연산 가속)

  • TPE는 코어 자원을 거의 소비하지 않는 디커플드 설계이며, 여러 코어가 하나의 TPE를 공유할 수 있음

  • TPE 내부에 4,000-bit 규모의 테일 레지스터 캐시를 두어 데이터 재사용을 극대화

4. 버스 & 시스템 인터페이스

  • Direct Connect Mode: CHI.E / CHI.F

  • Multi-Processor Mode: AXI4.0 / ACE4.0 + XL-300 인터커넥트

  • QoS 지원 (CBQRI 등)

  • 가상화: Type-1 / Type-2 하이퍼바이저 지원

5. Qwen3.8-27B와의 연관성

64코어 구성에서 Qwen3.8-27B를 돌렸을 때 Decode ≈ 30 tok/s, TTFT ≈ 1.9초를 기록했습니다. GPU 없이도 이 속도가 나오는 이유는 바로 위의 낮은 지연 캐시 계층 + TPE 행렬 가속 + 소프트웨어 최적화(SHL 런타임)가 결합됐기 때문입니다.

요약 포인트

  • 메모리 쪽 강점: 4사이클 L1 + 최대 3MB 프라이빗 L2 + 유연한 공유 L3 → LLM처럼 메모리 대역폭과 지연에 민감한 워크로드에 유리

  • 한계: 아직 공개된 정보가 “CPU IP” 수준이라, 실제 SoC에 통합될 때의 메인 메모리(HBM/DDR) 컨트롤러 세부 사항이나 최종 대역폭 수치는 제품마다 다를 수 있습니다.

_____________________________________________________________________________

이 칩은 오픈 소스 RISC-V ISA를 기반으로 하므로 알리바바는 x86 아키텍처 또는 ARM 설계와 관련된 라이선스 비용을 우회할 수 있습니다. 이를 통해 수출 제재나 혹은 특허 분쟁 없이 저렴한 비용으로 자체 프로세서를 제조할 수 있습니다. 단 GPU와 달리 쉬안테 C950은 소켓당 하나의 추론 스레드를 실행하므로 높은 동시성을 요구하는 공용 API보다는 엣지 배포 및 비공개 추론에 더 적합합니다. 제조 공정은 아마도 TSMC 5nm인 것으로 보이는데, 이 역시 지금은 다소 저렴하게 사용할 수 있습니다.

알리바바는 최근 Qwen-3.8 27B 모델을 공개했는데, 27B Dense 모델이면서 전세대 플래그쉽인 Qwen3.5-397B-A17B(MoE, total 397B / active 약 17B)를 주요 코딩 벤치마크에서 앞섰습니다. 전반적인 성능은 오푸스 4.6급에 견줄 수 있다는 이야기가 나올 정도입니다.

이전 포스트: https://blog.naver.com/jjy0501/224382017319

그런데 알리바바는 바로 쉬안테 C950 칩에 Qwen 3.8 27B 모델을 올려 지원하기 시작했습니다. 32GB 메모리 (구체적인 속도는 공개하지 않음)에서 초당 30개의 토큰을 디코딩하고 첫 번째 토큰 수신 시간(TTFT)을 단 1.9초로 단축했습니다. 속도는 아주 빠르진 않지만, 비교적 저렴한 자체 하드웨어에서 Qwen 3.8 27B를 서비스할 수 있게 되면서 비용을 크게 절감할 수 있게 된 것입니다.

참고로 최근 새로 업그레이드 한 인텔 270K 플러스 + DDR5 6400 + RTX 4080에서 돌려봤는데 Qwen 3.8 27B은 대략 토큰 속도 16-20t/s 정도 나옵니다. 좀 더 최적화해서 속도를 높일 여지가 있긴 한데, 아무튼 RISC-V 컴퓨터로 GPU 없이도 그에 맞먹는 속도를 낼 수 있으면 비용 절감 차원에선 상당히 유리한 게 아닐까 생각해 봅니다.

실제로 써본 초기 평가는 R 코딩 결과물은 제법 그럴 듯해 보이지만, 여기 저기 숨은 버그들이 존재합니다. 코드를 좀 장황하게 짜는 편이라서 어디가 잘못됐는지 오히려 쉽게 파악할 수 없기 때문에 너무 길게 생각하지 않도록 조정할 필요가 있습니다. 어제도 버그 잡는데 30분 넘게 걸렸습니다.

현재 프론티어 AI 대비 코딩 실력이 더 뛰어나다곤 할 수 없지만, 로컬 컴퓨터에서 제한없이 돌릴 수 있고 정보 유출 걱정이 없는 특징 때문에 앞으로 계속 쓸 것 같습니다. 상대적으로 대중적 인지도는 낮지만 알리바바 Qwen이 로컬 LLM에서 실사용 비중이 앞으로 꽤 커질 것으로 보이는 가운데 자체 하드웨어로 돌릴 수 있다면 미니 AI PC를 내놓을 수 있지 않을까 하는 생각도 드네요.

참고

https://wccftech.com/alibabas-tsmc-built-5nm-risc-v-chip-xuantie-c950-now-runs-qwen-3-8-27b-model-natively-unlocking-massive-vertical-integration-tailwinds/

댓글

이 블로그의 인기 게시물

100 테슬라급 자기장 도달

 미국의 로스 알라모스 국립 연구소 (Los Alamos National Laboratory) 에서 과학자들이 지금까지 인간이 개발한 가장 강력한 자기장을 발생시키는 장치 개발에 도전하고 있습니다. 자기장의 세기를 나타내는 방법으로 자기력선의 밀도를 나타내기 위해 단위 면적당 자기력선의 수를 표시하는 단위인 테슬라 (T) 가 있습니다. (1T = 1Wb/㎡  웨버 (Wb) 는 자속의 단위)   의료용으로 사용되는 초전도체를 이용한 MRI 의 경우 1.5 - 3 테슬라급의 강력한 자기장으로 인체 내부를 볼 수 있게 만들지만 과학 연구용으로 이보다 더 강력한 자기장이 필요할 수 있습니다. 최근에 등장한 90 테슬라급 자기장에 이어 이번에 로스 알라모스 국립 연구소에서는 100 테슬라급인 100.75 T 를 실현 했다고 합니다.   이를 구현한 것은 18000 파운드 (8.16 톤 정도) 의 코일과 여기에 에너지를 공급할 1200 메가줄 (Megajoule) 급 모터 제네레이터등의 설비입니다.  (   The 1,200-megajoule motor generator that powers the magnetic pulse.  )  이와 같은 연구를 통해 알아내고자 하는 것은  Quantum Phase transitions and new ultra high field magnetic states Electronic Structure determination Topologically protected states of matter  로 요약할 수 있다고 합니다.   아무튼 수 T 급 MRI 만 해도 자기장의 힘이 엄청난데 100 T 라니 엄청난 자기장이네요. 이는 지구 자기장 세기보다 200만배 강력한 (물론 좁은 범위에서 작용하는 자기장이라 지구 전체...

고대 양서류 이야기 (2) - 악어를 닮은 거대 양서류들

  페름기에는 다양한 양막류가 진화해서 앞서 소개한 육상형 템노스폰딜리는 점차 설 자리를 잃게 됩니다. 하지만 양서류는 본래 자신의 서식지인 물과 습지에서 여전히 번성을 누렸습니다. 당시에는 악어류 같은 대형 양서형 파충류도 없던 시절이었기 때문에 이와 비슷한 생태학적 지위는 여전히 양서류의 몫이었습니다. 이들에 대한 이야기는 제 책인 포식자에서 비교적 간단히 다뤘는데, 오늘은 여기에 대한 보충 설명입니다.  책 정보:  http://book.naver.com/bookdb/book_detail.nhn?bid=13347200 Yes 24:  http://www.yes24.com/24/goods/58772859 11번가:  http://books.11st.co.kr/product/SellerProductDetail.tmall?method=getSellerProductDetail&prdNo=1977867160 알라딘:  http://www.aladin.co.kr/shop/wproduct.aspx?ItemId=134877825 교보문고:  http://www.kyobobook.co.kr/product/detailViewKor.laf?ejkGb=KOR&mallGb=KOR&barcode=9788970447988&orderClick=LAG&Kc= 인터파크 :  http://book.interpark.com/product/BookDisplay.do?_method=detail&sc.prdNo=279593764&sc.saNo=003002003&bid1=search_auto&bid2=detail&bid3=prd_img&bid4=001 영풍문고:  http://www.ypbooks.co.kr/book.yp?bookcd=100843205&gubun=NV ...

이빨이 다시 진화한 개구리

  ( CT scans of Gastrotheca guentheri skulls revealed what appeared to be identical rows of teeth on both the upper and lower jaws, which researchers later confirmed through dissection. Credit: Florida Museum/Daniel Paluh )  개구리는 2억년 전 진화 과정에서 이빨을 잃어버리고 큰 턱과 혀를 이용해 곤충 같은 작은 먹이를 잡아 먹는 방향으로 진화했습니다. 파충류나 포유류 같은 다른 사지류와의 경쟁에서 밀려 양서류가 쇠퇴하고 멸종하던 시기에도 개구리는 여전히 생존할 수 있었던 비결입니다.   이빨이 없는 덕분에 큰 혀를 발사하기 편해졌을지는 모르지만, 이빨이 없으면 종종 불편할 때가 있습니다. 씹는 대신 삼키기 때문에 음식을 씹을 수 없다는 점은 문제되지 않지만, 필사적으로 달아나려는 먹이를 잡기 힘들기 때문입니다. 이런 이유 때문에 일부 개구리는 이빨 같이 보이는 엄니 (fang)을 지니고 있으나 이는 사라진 이빨이 다시 난 것이 아니라 다른 부분이 진화한 것입니다.   이는 돌로의 법칙 ( Dollo's Law )으로 알려져 있습니다. 진화 과정에서 퇴화한 부분이 다시 생겨나지 않으며 대신 필요하면 다른 부분이 진화해 그 역할을 대신한다는 것입니다. 예를 들어 아가미가 사라진 사지 동물은 다시 물에 들어온다고 해도 아가미가 다시 생기진 않습니다. 대신 고래처럼 폐가 커져서 그 기능을 대신하게 됩니다.   하지만 모든 법칙엔 예외가 있기 마련입니다. 남미에서 발견된 멸종 위기 개구리 중 하나인 구엔터 유대류 개구리 ( Gastrotheca guentheri, Guenther's marsupial frog, dentate marsupial frog)는 완전한 형태의 이빨을 지니고 있습니다. 참고로 유대류 개구리라는 명칭은...