기본 콘텐츠로 건너뛰기

지푸 GLM-5.3 플래시 - 100% 중국산 AI 칩으로 구동?

 




(출처: 지푸)

​

​

​

누군가 8월 20일에 OpenRouter와 OpenCode에 익명으로 Ox Alpha를 배포했습니다. 이 배포판은 100만 토큰 규모의 멀티모달(텍스트, 오디오, 비디오) 컨텍스트 창, 131,072 토큰 출력 제한, 그리고 일주일 동안 하루 100조 개의 토큰을 처리할 수 있는 용량을 완전 무료로 제공했습니다.

​

옥스 알파를 누가 배포했는지를 두고 논쟁이 오갔는데, 대부분 의견은 중국 AI 연구소인 지푸(Zhipu, Z.ai) GLM 계열에 속한다는 데 모아졌습니다. 비디오 인코딩 파이프라인, 토크나이저 연산 방식, 문자 단위 응답이 Zhipu의 아키텍처와 매우 유사했기 때문입니다.

​

그리고 지푸는 옥스 알파가 자사의 GLM-5.3-Flash 모델임을 공개했습니다. 지푸는 전용 블로그 에 다음과 같이 발표했습니다 .

​

"출시 전, 사용자 피드백을 수집하기 위해 OpenCode와 OpenRouter에서 ox-alpha라는 익명으로 GLM-5.3-Flash를 테스트했습니다. 그 결과, 중국산 AI 칩에서 처리되는 모든 트래픽에도 불구하고 해당 모델은 금세 그 주에 가장 인기 있는 모델이 되었습니다."

​

여기서 가장 주목할 점은 전부 중국산 칩에서 연산이 수행되었다는 점입니다. 구체적인 GPU는 공개하지 않았지만, 화웨이의 Ascend가 유력한 후보로 추종됩니다. 화웨이 어센드는 엔비디아 GPU보다 성능이 낮지만, 현재 중국 내에서 구할 수 있는 가장 진보한 AI 가속기입니다.

​

물론 이렇게 낮은 성능의 GPU에서 충분한 토큰을 뽑아내기 위해 중국 AI 모델은 효율성을 높이는데 집중해 서구 모델 대비 가성비가 월등한 특징을 지니고 있습니다. 그 비결에 대해 아래 정리했습니다.

​

________________________________________________________________________________

​

Z.ai(Zhipu)의 GLM-5.3-Flash는 초저비용 추론을 목표로 설계된 모델입니다. 총 파라미터 320B(활성 18B)의 MoE 구조에 여러 효율화 기법을 결합해, 이전 세대(GLM-5.3) 대비 attention 연산량을 3.0배, KV 캐시 크기를 4.4배 줄이면서도 긴 컨텍스트(최대 1M 토큰) 성능을 유지합니다. 주요 아키텍처 요소는 다음과 같습니다.

​

1. Hybrid Sparse + Linear Attention (핵심 효율화)

일반적인 Transformer의 dense attention은 시퀀스 길이에 따라 연산과 메모리가 제곱으로 증가합니다. GLM-5.3-Flash는 이를 두 가지 방식으로 혼합합니다.

  • Linear Attention: 텍스트를 순차적으로 스캔하면서 하나의 압축된 “상태 요약”(state/KV cache)을 계속 업데이트합니다. 로컬 의존성을 빠르게 처리하며, 메모리와 연산을 선형으로 유지합니다.

  • Sparse Attention: 중요한 전역 정보만 선택적으로 검색합니다. 상세한 정보를 별도의 인덱스 형태로 저장해 두고, 필요할 때만 꺼내 씁니다.

이 조합으로 긴 컨텍스트에서도 연산량과 메모리를 크게 줄입니다. Z.ai 공식 비교에 따르면, GLM-5.3 대비 attention 연산(per head per layer)이 3.0배, 평균 KV 캐시 크기가 4.4배 감소했으며, 비교 대상인 DeepSeek-V4-Flash나 Kimi-K3보다도 attention 연산량이 가장 낮습니다.

​

2. IndexPool (인덱스 압축)

Sparse attention의 인덱서가 1M 토큰 컨텍스트에서 생기는 지연과 메모리 오버헤드를 줄이기 위해 도입했습니다.

4개의 인덱서 키 벡터를 가중 풀링(weighted pooling)으로 1개로 압축해, 인덱싱 비용을 낮춥니다.

​

3. Manifold-Constrained Hyper-Connections (mHC)

레이어 간 정보 전달 방식을 개선한 기법입니다.

일반적인 residual/하이퍼커넥션이 정보를 무분별하게 섞으면 불안정해질 수 있는데, mHC는 Birkhoff 다면체(manifold) 위에 연결을 강제합니다.

정보를 섞을 때 총 볼륨이 항상 100%가 되도록 Sinkhorn-Knopp 알고리즘으로 자동 조절합니다.

결과적으로 복잡한 정보를 안정적으로 전달하면서도 메모리 벽(memory wall)과 시스템 혼잡을 피합니다.

​

4. 전체 구조 및 추가 최적화

  • 파라미터 효율: 총 320B지만 활성 파라미터는 18B로, 이전 세대 대비 활성 파라미터와 레이어 수를 크게 줄였습니다(예: GLM-4.5 계열 대비 활성 파라미터 거의 절반).

  • 사전학습 데이터: 30T 토큰 규모의 최신 멀티모달 코퍼스를 사용해, 적은 연산으로도 높은 지능을 뽑아내도록 했습니다.

  • 서빙 최적화: 중국산 칩 클러스터에서 Encode–Prefill–Decode(EPD) 분리 아키텍처, SGLang 기반 커스텀 엔진, W8A8 양자화, 하이브리드 캐시 양자화, Layer Split 등을 적용해 실제 서비스에서 추가 3배의 엔드투엔드 성능 향상을 달성했습니다.

​

효과 요약

  • 비용: Claude Opus 4.8급 성능에 약 1/10 수준의 가격(또는 그 이하).

  • 속도·효율: 긴 컨텍스트에서도 KV 캐시와 attention 연산이 크게 줄어 추론 속도와 처리량이 향상.

  • 멀티모달: 텍스트·이미지·비디오를 네이티브로 지원하면서도 위 효율을 유지.

__________________________________________________________________________________

아무튼 중국 AI가 모델 성능과 하드웨어 모두에서 미국을 상당히 가깝게 따라잡는 모습을 보이고 있는데, 장기적으로 연산 자원을 아끼는 중국 모델이 승산이 높지 않을까 생각합니다. 현재 AI는 투자 비용을 쉽게 회수하기 어려운 구조이기 때문입니다. 여기에 중국 AI 들이 모델을 무료로 풀고 있는 만큼 결국 나중에는 가성비 모델이 이기는 구조가 될 수밖에 없을 것으로 예상해 봅니다.

​

참고

​

​

https://wccftech.com/zhipu-z-ai-unmasks-the-mystery-ox-alpha-model-as-glm-5-3-flash-revealing-that-it-was-run-entirely-on-chinese-gpus-while-serving-100-trillion-tokens-day/

​

댓글

이 블로그의 인기 게시물

100 테슬라급 자기장 도달

 미국의 로스 알라모스 국립 연구소 (Los Alamos National Laboratory) 에서 과학자들이 지금까지 인간이 개발한 가장 강력한 자기장을 발생시키는 장치 개발에 도전하고 있습니다. 자기장의 세기를 나타내는 방법으로 자기력선의 밀도를 나타내기 위해 단위 면적당 자기력선의 수를 표시하는 단위인 테슬라 (T) 가 있습니다. (1T = 1Wb/㎡  웨버 (Wb) 는 자속의 단위)   의료용으로 사용되는 초전도체를 이용한 MRI 의 경우 1.5 - 3 테슬라급의 강력한 자기장으로 인체 내부를 볼 수 있게 만들지만 과학 연구용으로 이보다 더 강력한 자기장이 필요할 수 있습니다. 최근에 등장한 90 테슬라급 자기장에 이어 이번에 로스 알라모스 국립 연구소에서는 100 테슬라급인 100.75 T 를 실현 했다고 합니다.   이를 구현한 것은 18000 파운드 (8.16 톤 정도) 의 코일과 여기에 에너지를 공급할 1200 메가줄 (Megajoule) 급 모터 제네레이터등의 설비입니다.  (   The 1,200-megajoule motor generator that powers the magnetic pulse.  )  이와 같은 연구를 통해 알아내고자 하는 것은  Quantum Phase transitions and new ultra high field magnetic states Electronic Structure determination Topologically protected states of matter  로 요약할 수 있다고 합니다.   아무튼 수 T 급 MRI 만 해도 자기장의 힘이 엄청난데 100 T 라니 엄청난 자기장이네요. 이는 지구 자기장 세기보다 200만배 강력한 (물론 좁은 범위에서 작용하는 자기장이라 지구 전체...

고대 양서류 이야기 (2) - 악어를 닮은 거대 양서류들

  페름기에는 다양한 양막류가 진화해서 앞서 소개한 육상형 템노스폰딜리는 점차 설 자리를 잃게 됩니다. 하지만 양서류는 본래 자신의 서식지인 물과 습지에서 여전히 번성을 누렸습니다. 당시에는 악어류 같은 대형 양서형 파충류도 없던 시절이었기 때문에 이와 비슷한 생태학적 지위는 여전히 양서류의 몫이었습니다. 이들에 대한 이야기는 제 책인 포식자에서 비교적 간단히 다뤘는데, 오늘은 여기에 대한 보충 설명입니다.  책 정보:  http://book.naver.com/bookdb/book_detail.nhn?bid=13347200 Yes 24:  http://www.yes24.com/24/goods/58772859 11번가:  http://books.11st.co.kr/product/SellerProductDetail.tmall?method=getSellerProductDetail&prdNo=1977867160 알라딘:  http://www.aladin.co.kr/shop/wproduct.aspx?ItemId=134877825 교보문고:  http://www.kyobobook.co.kr/product/detailViewKor.laf?ejkGb=KOR&mallGb=KOR&barcode=9788970447988&orderClick=LAG&Kc= 인터파크 :  http://book.interpark.com/product/BookDisplay.do?_method=detail&sc.prdNo=279593764&sc.saNo=003002003&bid1=search_auto&bid2=detail&bid3=prd_img&bid4=001 영풍문고:  http://www.ypbooks.co.kr/book.yp?bookcd=100843205&gubun=NV ...

이빨이 다시 진화한 개구리

  ( CT scans of Gastrotheca guentheri skulls revealed what appeared to be identical rows of teeth on both the upper and lower jaws, which researchers later confirmed through dissection. Credit: Florida Museum/Daniel Paluh )  개구리는 2억년 전 진화 과정에서 이빨을 잃어버리고 큰 턱과 혀를 이용해 곤충 같은 작은 먹이를 잡아 먹는 방향으로 진화했습니다. 파충류나 포유류 같은 다른 사지류와의 경쟁에서 밀려 양서류가 쇠퇴하고 멸종하던 시기에도 개구리는 여전히 생존할 수 있었던 비결입니다.   이빨이 없는 덕분에 큰 혀를 발사하기 편해졌을지는 모르지만, 이빨이 없으면 종종 불편할 때가 있습니다. 씹는 대신 삼키기 때문에 음식을 씹을 수 없다는 점은 문제되지 않지만, 필사적으로 달아나려는 먹이를 잡기 힘들기 때문입니다. 이런 이유 때문에 일부 개구리는 이빨 같이 보이는 엄니 (fang)을 지니고 있으나 이는 사라진 이빨이 다시 난 것이 아니라 다른 부분이 진화한 것입니다.   이는 돌로의 법칙 ( Dollo's Law )으로 알려져 있습니다. 진화 과정에서 퇴화한 부분이 다시 생겨나지 않으며 대신 필요하면 다른 부분이 진화해 그 역할을 대신한다는 것입니다. 예를 들어 아가미가 사라진 사지 동물은 다시 물에 들어온다고 해도 아가미가 다시 생기진 않습니다. 대신 고래처럼 폐가 커져서 그 기능을 대신하게 됩니다.   하지만 모든 법칙엔 예외가 있기 마련입니다. 남미에서 발견된 멸종 위기 개구리 중 하나인 구엔터 유대류 개구리 ( Gastrotheca guentheri, Guenther's marsupial frog, dentate marsupial frog)는 완전한 형태의 이빨을 지니고 있습니다. 참고로 유대류 개구리라는 명칭은...