(출처: 알리바바)
알리바바는 2026년 3월, 엣지 AI용 RISC-V 기반 칩인 쉬안테 (XuanTie) C950을 공개했습니다. 일반적인 ASIC과 달리 쉬안테 C950은 AI 워크로드 처리에 GPU를 사용하지 않습니다. 대신 고성능 64비트 RISC-V 코어 64개를 집적한 프로세서로 클럭 주파수는 최대 3.20GHz까지 작동합니다. 아키텍처를 보면 클러스터당 8개의 코어로 구성된 여러 클러스터가 고속 AMBA CHI 패브릭을 사용하여 네이티브 방식으로 연결됩니다.
AI 생성 정리 (그록)
XuanTie C950 아키텍처와 메모리 서브시스템에 대한 상세 정보를 정리했습니다. (공식 데이터시트·발표 자료·기술 기사 기반)
1. 기본 아키텍처 개요
ISA: RISC-V RVA23 (RVA23.1 포함) 프로필 완전 지원
필수 확장 + 거의 모든 선택 확장 지원 (Vector Crypto, Zacas, Zama16b, Smmtt, CoVE, AIA, RAS 등)
마이크로아키텍처:
64비트 슈퍼스칼라 아웃오브오더(Out-of-Order)
8-wide decode (한 번에 8개 명령어 디코드)
16-stage 파이프라인
아웃오브오더 윈도우: 1,000개 이상 명령어
TAGE 기반 고급 분기 예측 + 하드웨어 지능형 데이터 프리페치
클럭: 최대 3.2 GHz
성능: SPECint2006 단핵 70점 이상 (약 22+/GHz) → RISC-V 역대 최고 수준
공정: 5nm (TSMC로 추정, 공식 확인은 없음)
클러스터 구성: 클러스터당 최대 8코어, 여러 클러스터를 연결해 최대 64코어 구성 가능
클러스터 내부: 고속 AMBA CHI (CHI.E / CHI.F) 패브릭으로 연결
2. 메모리 서브시스템 (캐시 & MMU) — 핵심 부분
메모리 모델: AVWMO / TSO를 동적으로 전환 가능
프리페치: 하드웨어 레벨 지능형 데이터 프리페칭으로 메모리 스트링을 미리 캐시에 로드
대역폭: 이전 세대(C920) 대비 메모리 대역폭 4배 이상 향상 주장
이 캐시 계층 구조가 LLM 추론에서 중요한 역할을 합니다. 낮은 L1 지연 + 큰 프라이빗 L2 + 유연한 L3 조합으로 가중치와 활성화 값을 효율적으로 재사용합니다.
3. AI 가속 (메모리와 밀접한 부분)
XuanTie TPE (Tensor Processing Engine): AME (Attached Matrix Extension)를 통해 코어에 긴밀히 통합
단 TPE당 최대 8 TOPS
지원 데이터 타입: INT4/INT8, FP8, MXFP8, MXFP4, RVFP4, FP16, BF16 등
Matrix 엔진 + Vector 엔진 병렬 실행 가능 (Softmax, SiLU, GELU 등 연산 가속)
TPE는 코어 자원을 거의 소비하지 않는 디커플드 설계이며, 여러 코어가 하나의 TPE를 공유할 수 있음
TPE 내부에 4,000-bit 규모의 테일 레지스터 캐시를 두어 데이터 재사용을 극대화
4. 버스 & 시스템 인터페이스
Direct Connect Mode: CHI.E / CHI.F
Multi-Processor Mode: AXI4.0 / ACE4.0 + XL-300 인터커넥트
QoS 지원 (CBQRI 등)
가상화: Type-1 / Type-2 하이퍼바이저 지원
5. Qwen3.8-27B와의 연관성
64코어 구성에서 Qwen3.8-27B를 돌렸을 때 Decode ≈ 30 tok/s, TTFT ≈ 1.9초를 기록했습니다. GPU 없이도 이 속도가 나오는 이유는 바로 위의 낮은 지연 캐시 계층 + TPE 행렬 가속 + 소프트웨어 최적화(SHL 런타임)가 결합됐기 때문입니다.
요약 포인트
메모리 쪽 강점: 4사이클 L1 + 최대 3MB 프라이빗 L2 + 유연한 공유 L3 → LLM처럼 메모리 대역폭과 지연에 민감한 워크로드에 유리
한계: 아직 공개된 정보가 “CPU IP” 수준이라, 실제 SoC에 통합될 때의 메인 메모리(HBM/DDR) 컨트롤러 세부 사항이나 최종 대역폭 수치는 제품마다 다를 수 있습니다.
_____________________________________________________________________________
이 칩은 오픈 소스 RISC-V ISA를 기반으로 하므로 알리바바는 x86 아키텍처 또는 ARM 설계와 관련된 라이선스 비용을 우회할 수 있습니다. 이를 통해 수출 제재나 혹은 특허 분쟁 없이 저렴한 비용으로 자체 프로세서를 제조할 수 있습니다. 단 GPU와 달리 쉬안테 C950은 소켓당 하나의 추론 스레드를 실행하므로 높은 동시성을 요구하는 공용 API보다는 엣지 배포 및 비공개 추론에 더 적합합니다. 제조 공정은 아마도 TSMC 5nm인 것으로 보이는데, 이 역시 지금은 다소 저렴하게 사용할 수 있습니다.
알리바바는 최근 Qwen-3.8 27B 모델을 공개했는데, 27B Dense 모델이면서 전세대 플래그쉽인 Qwen3.5-397B-A17B(MoE, total 397B / active 약 17B)를 주요 코딩 벤치마크에서 앞섰습니다. 전반적인 성능은 오푸스 4.6급에 견줄 수 있다는 이야기가 나올 정도입니다.
이전 포스트: https://blog.naver.com/jjy0501/224382017319
그런데 알리바바는 바로 쉬안테 C950 칩에 Qwen 3.8 27B 모델을 올려 지원하기 시작했습니다. 32GB 메모리 (구체적인 속도는 공개하지 않음)에서 초당 30개의 토큰을 디코딩하고 첫 번째 토큰 수신 시간(TTFT)을 단 1.9초로 단축했습니다. 속도는 아주 빠르진 않지만, 비교적 저렴한 자체 하드웨어에서 Qwen 3.8 27B를 서비스할 수 있게 되면서 비용을 크게 절감할 수 있게 된 것입니다.
참고로 최근 새로 업그레이드 한 인텔 270K 플러스 + DDR5 6400 + RTX 4080에서 돌려봤는데 Qwen 3.8 27B은 대략 토큰 속도 16-20t/s 정도 나옵니다. 좀 더 최적화해서 속도를 높일 여지가 있긴 한데, 아무튼 RISC-V 컴퓨터로 GPU 없이도 그에 맞먹는 속도를 낼 수 있으면 비용 절감 차원에선 상당히 유리한 게 아닐까 생각해 봅니다.
실제로 써본 초기 평가는 R 코딩 결과물은 제법 그럴 듯해 보이지만, 여기 저기 숨은 버그들이 존재합니다. 코드를 좀 장황하게 짜는 편이라서 어디가 잘못됐는지 오히려 쉽게 파악할 수 없기 때문에 너무 길게 생각하지 않도록 조정할 필요가 있습니다. 어제도 버그 잡는데 30분 넘게 걸렸습니다.
현재 프론티어 AI 대비 코딩 실력이 더 뛰어나다곤 할 수 없지만, 로컬 컴퓨터에서 제한없이 돌릴 수 있고 정보 유출 걱정이 없는 특징 때문에 앞으로 계속 쓸 것 같습니다. 상대적으로 대중적 인지도는 낮지만 알리바바 Qwen이 로컬 LLM에서 실사용 비중이 앞으로 꽤 커질 것으로 보이는 가운데 자체 하드웨어로 돌릴 수 있다면 미니 AI PC를 내놓을 수 있지 않을까 하는 생각도 드네요.
참고




댓글
댓글 쓰기