(출처: 리플렉션)
현재 오픈 웨이트 AI 모델 분야에서는 중국이 세계 1위라고 해도 과언이 아닌 상태입니다. 딥시크, 지푸. Qwen, 키미 K3 같은 쟁쟁한 공개 모델들은 미국의 폐쇄 모델에 근접하는 성능을 내면서 누구나 다운로드 받아 원하는 대로 수정할 수 있고 내부적으로 사용 가능해 큰 인기를 끌고 있습니다. 하지만 결국 이로 인한 중국의 AI 헤게모니 독점을 우려하는 시각도 있습니다.
최근 엔비디아의 지원을 받은 미국 리플렉션 Reflection은 매우 효율적인 501B 파라미터 오픈웨이트 모델인 빔 Beam을 공개했습니다. 빔은 희소 혼합형 전문가 모델(MoE)로 활성 파라미터는 23B 정도입니다. 모든 파라미터를 다 연산하지 않고 일부 전문가만 사용하기 때문에 모델의 크기 대비 토큰 속도가 빨라 연산 자원이 부족한 중국 모델들이 즐겨 사용하는 방법입니다.
리플렉션응 빔이 GLM 5.2보다 3~4배, 주요 서구 오픈 모델보다 4배 이상 효율적이라고 주장했는데, 아직은 실제 모델을 공개하지 않은 상태로 일부 벤치마크 결과만 보여주고 있습니다. 빔은 Qwen 3.8 Max 및 GLM 5.2와 같은 모델과 비교하여 'SWE Bench Verified'에서 80.9점, 'Terminal Bench v2.1'에서 80.1점을 정도로 두 모델 사이에 점수를 보여주고 있습니다.
리플렉션은 빔을 효율적으로 만들기 위해 다음과 같은 방법을 사용했습니다.
전문가 활용도 균등화 - 모든 전문 기술자/요리사들이 거의 동일한 양의 업무를 배정받습니다. 이는 특정 전문가가 과부하에 걸리거나 오랫동안 유휴 상태에 놓이지 않는다는 것을 의미합니다. Reflection에 따르면, Beam에서 가장 바쁜 전문가는 평균보다 불과 1.04배만 더 바빴는데, 이는 거의 완벽하게 균등한 수준입니다.
깊이 기반 잔차 스케일링 및 제어된 잔차 스트림 (Depth-based residual scaling and controlled residual stream) - 모델은 일반적으로 수십 개의 연속적인 레이어를 통해 토큰을 처리하며, 각 하위 레이어(예: 어텐션 및 피드포워드 네트워크)의 수학적 출력은 지속적으로 누적됩니다. 그러나 모델의 규모가 매우 커지면 이러한 누적 합산으로 인해 활성화 값이 급격히 증가하고 수치적 이상치가 발생하여 신호 왜곡이나 학습 불안정성이 초래될 수 있습니다. 이를 해결하기 위해 Beam은 토큰이 네트워크를 더 깊이 통과함에 따라 각 하위 레이어 출력의 크기를 점진적으로 줄이는 스케일링 계수를 사용하여 정보가 깨끗하고 예측 가능한 방식으로 흐르도록 합니다.
SandwichNorm - 일반적인 모델은 토큰이 하위 레이어에 들어가기 전이나 나온 후에 정규화를 수행합니다. 이는 토큰 값이 엄격하고 예측 가능한 범위 내에 유지되도록 보장합니다. 하지만 Beam은 각 하위 레이어의 진입점과 출구점(샌드위치 방식)에서 토큰을 정규화하여 활성화 값(모델이 여러 변환 레이어를 거치면서 토큰을 처리하는 과정에서 생성하는 내부 수학적 표현으로, 은닉 상태라고도 함)이 절대 변동하거나 극단적인 수치 이상치를 형성하지 않도록 합니다.
어텐션 게이팅 (Attention Gating) - 모델이 어텐션을 계산(KV 캐시 생성)한 후, 어텐션 결과의 실제 사용 정도를 결정하는 일종의 "볼륨 조절 장치"(게이트)가 있습니다. 이를 통해 신호의 양을 각기 다른 부분에 대해 조절할 수 있어 모델의 선택성과 안정성을 향상시킬 수 있습니다.
FP32 잔차 누적 - 모델은 속도와 메모리 사용량을 줄이기 위해 더 저렴하고 정밀도가 낮은 숫자를 사용하지만, 중요한 잔차(스킵 연결) 덧셈은 여전히 정밀도가 높은 32비트 숫자로 수행됩니다. 이는 미세한 반올림 오류가 누적되어 학습이 중단되는 것을 방지합니다.
빔은 다른 AI 모델과 마찬가지로 강화 학습(RL)을 통해 모델의 지능을 높였습니다. 이 과정에서 모델은 자체 샌드박스에 있는 수많은 에이전트와 연결되어 코딩과 같은 실용적인 기술을 학습하게 됩니다. 리플렉션은 빔을 4주(28일) 동안 학습시키고 10,500개 이상의 NVIDIA GB300 GPU를 사용하여 13억 개의 샌드박스를 활용했다고 밝혔습니다. 이는 하루에 4,640만 개의 샌드박스를 처리한 것과 같습니다. 강화 학습은 100만 개의 코딩, 에이전트 및 STEM 환경에 걸쳐 진행되었으며, 1억 번의 롤아웃(에이전트가 주어진 환경과 상호 작용할 때 생성되는 결과 및 그에 따른 보상)을 포함했습니다.
다만 아직 실제 모델을 공개한 게 아니고 일부 유리한 벤치마크 결과만 공개했을 가능성이 높아 좀 더 결과를 기다려봐야 할 것으로 보입니다. 특히 더 작은 모델인 Qwen 3.8 플래시 넥스트와 비교해서 과연 경쟁력이 있는지 궁금합니다.
참고

댓글
댓글 쓰기