(출처: 지푸)
누군가 8월 20일에 OpenRouter와 OpenCode에 익명으로 Ox Alpha를 배포했습니다. 이 배포판은 100만 토큰 규모의 멀티모달(텍스트, 오디오, 비디오) 컨텍스트 창, 131,072 토큰 출력 제한, 그리고 일주일 동안 하루 100조 개의 토큰을 처리할 수 있는 용량을 완전 무료로 제공했습니다.
옥스 알파를 누가 배포했는지를 두고 논쟁이 오갔는데, 대부분 의견은 중국 AI 연구소인 지푸(Zhipu, Z.ai) GLM 계열에 속한다는 데 모아졌습니다. 비디오 인코딩 파이프라인, 토크나이저 연산 방식, 문자 단위 응답이 Zhipu의 아키텍처와 매우 유사했기 때문입니다.
그리고 지푸는 옥스 알파가 자사의 GLM-5.3-Flash 모델임을 공개했습니다. 지푸는 전용 블로그 에 다음과 같이 발표했습니다 .
"출시 전, 사용자 피드백을 수집하기 위해 OpenCode와 OpenRouter에서 ox-alpha라는 익명으로 GLM-5.3-Flash를 테스트했습니다. 그 결과, 중국산 AI 칩에서 처리되는 모든 트래픽에도 불구하고 해당 모델은 금세 그 주에 가장 인기 있는 모델이 되었습니다."
여기서 가장 주목할 점은 전부 중국산 칩에서 연산이 수행되었다는 점입니다. 구체적인 GPU는 공개하지 않았지만, 화웨이의 Ascend가 유력한 후보로 추종됩니다. 화웨이 어센드는 엔비디아 GPU보다 성능이 낮지만, 현재 중국 내에서 구할 수 있는 가장 진보한 AI 가속기입니다.
물론 이렇게 낮은 성능의 GPU에서 충분한 토큰을 뽑아내기 위해 중국 AI 모델은 효율성을 높이는데 집중해 서구 모델 대비 가성비가 월등한 특징을 지니고 있습니다. 그 비결에 대해 아래 정리했습니다.
________________________________________________________________________________
Z.ai(Zhipu)의 GLM-5.3-Flash는 초저비용 추론을 목표로 설계된 모델입니다. 총 파라미터 320B(활성 18B)의 MoE 구조에 여러 효율화 기법을 결합해, 이전 세대(GLM-5.3) 대비 attention 연산량을 3.0배, KV 캐시 크기를 4.4배 줄이면서도 긴 컨텍스트(최대 1M 토큰) 성능을 유지합니다. 주요 아키텍처 요소는 다음과 같습니다.
1. Hybrid Sparse + Linear Attention (핵심 효율화)
일반적인 Transformer의 dense attention은 시퀀스 길이에 따라 연산과 메모리가 제곱으로 증가합니다. GLM-5.3-Flash는 이를 두 가지 방식으로 혼합합니다.
Linear Attention: 텍스트를 순차적으로 스캔하면서 하나의 압축된 “상태 요약”(state/KV cache)을 계속 업데이트합니다. 로컬 의존성을 빠르게 처리하며, 메모리와 연산을 선형으로 유지합니다.
Sparse Attention: 중요한 전역 정보만 선택적으로 검색합니다. 상세한 정보를 별도의 인덱스 형태로 저장해 두고, 필요할 때만 꺼내 씁니다.
이 조합으로 긴 컨텍스트에서도 연산량과 메모리를 크게 줄입니다. Z.ai 공식 비교에 따르면, GLM-5.3 대비 attention 연산(per head per layer)이 3.0배, 평균 KV 캐시 크기가 4.4배 감소했으며, 비교 대상인 DeepSeek-V4-Flash나 Kimi-K3보다도 attention 연산량이 가장 낮습니다.
2. IndexPool (인덱스 압축)
Sparse attention의 인덱서가 1M 토큰 컨텍스트에서 생기는 지연과 메모리 오버헤드를 줄이기 위해 도입했습니다.
4개의 인덱서 키 벡터를 가중 풀링(weighted pooling)으로 1개로 압축해, 인덱싱 비용을 낮춥니다.
3. Manifold-Constrained Hyper-Connections (mHC)
레이어 간 정보 전달 방식을 개선한 기법입니다.
일반적인 residual/하이퍼커넥션이 정보를 무분별하게 섞으면 불안정해질 수 있는데, mHC는 Birkhoff 다면체(manifold) 위에 연결을 강제합니다.
정보를 섞을 때 총 볼륨이 항상 100%가 되도록 Sinkhorn-Knopp 알고리즘으로 자동 조절합니다.
결과적으로 복잡한 정보를 안정적으로 전달하면서도 메모리 벽(memory wall)과 시스템 혼잡을 피합니다.
4. 전체 구조 및 추가 최적화
파라미터 효율: 총 320B지만 활성 파라미터는 18B로, 이전 세대 대비 활성 파라미터와 레이어 수를 크게 줄였습니다(예: GLM-4.5 계열 대비 활성 파라미터 거의 절반).
사전학습 데이터: 30T 토큰 규모의 최신 멀티모달 코퍼스를 사용해, 적은 연산으로도 높은 지능을 뽑아내도록 했습니다.
서빙 최적화: 중국산 칩 클러스터에서 Encode–Prefill–Decode(EPD) 분리 아키텍처, SGLang 기반 커스텀 엔진, W8A8 양자화, 하이브리드 캐시 양자화, Layer Split 등을 적용해 실제 서비스에서 추가 3배의 엔드투엔드 성능 향상을 달성했습니다.
효과 요약
비용: Claude Opus 4.8급 성능에 약 1/10 수준의 가격(또는 그 이하).
속도·효율: 긴 컨텍스트에서도 KV 캐시와 attention 연산이 크게 줄어 추론 속도와 처리량이 향상.
멀티모달: 텍스트·이미지·비디오를 네이티브로 지원하면서도 위 효율을 유지.
__________________________________________________________________________________
아무튼 중국 AI가 모델 성능과 하드웨어 모두에서 미국을 상당히 가깝게 따라잡는 모습을 보이고 있는데, 장기적으로 연산 자원을 아끼는 중국 모델이 승산이 높지 않을까 생각합니다. 현재 AI는 투자 비용을 쉽게 회수하기 어려운 구조이기 때문입니다. 여기에 중국 AI 들이 모델을 무료로 풀고 있는 만큼 결국 나중에는 가성비 모델이 이기는 구조가 될 수밖에 없을 것으로 예상해 봅니다.
참고



댓글
댓글 쓰기