‘전문가 혼합(MoE)이란 무엇이며 현대 LLM의 기반 아키텍처는 어떻게 작동하는가’를 이해하려면 또 하나의 AI 유행어로 받아들이기보다 실제 선택과 연결해 보는 편이 쉽습니다. 이 AI Tools Radar 가이드는 작동 원리와 중요한 절충점, 도구나 워크플로를 도입하기 전에 물어야 할 질문에 초점을 맞춥니다.
전문가 혼합(MoE) AI는 계산을 전문가라고 부르는 여러 전문 하위 네트워크에 나누는 신경망 아키텍처입니다. 가벼운 게이팅 네트워크가 각 입력 토큰을 처리할 전문가를 선택합니다. 매 순간 일부만 활성화됩니다. 이러한 선택적 라우팅은 모든 토큰에 모든 매개변수를 사용하는 전통적인 밀집 모델과 MoE를 구분합니다.
이 설계는 전체 매개변수를 수천억 개까지 늘리면서 추론 비용을 훨씬 작은 모델과 비슷하게 유지할 수 있어 주목받았습니다. Mixtral 8x7B와 여러 GPT-4 버전이 이 패턴을 사용합니다. 작동 원리를 이해하면 모델 규모와 효율성에 관한 주장을 평가하는 데 도움이 됩니다.
핵심 요점. • MoE AI는 하나의 큰 피드포워드 네트워크를 여러 작은 전문가 네트워크와 적절한 일부를 선택하는 라우터로 대체합니다. • 희소 활성화는 토큰마다 고정된 수의 전문가만 처리하게 하므로 전체 매개변수가 늘어도 토큰당 계산량이 거의 일정합니다. • Mixtral 8x7B 같은 모델은 추론 중 비슷한 수의 활성 매개변수를 쓰면서 벤치마크에서 밀집 기준 모델과 같거나 더 높은 성능을 낼 수 있음을 보여 줍니다. • 전문가 간 부하 균형과 라우터 안정성에 추가 기법이 필요해 학습은 밀집 모델보다 복잡합니다. • 같은 아키텍처가 공개 모델과 독점 시스템에 모두 쓰인다는 사실은 연구를 넘어 상용 대규모 언어 모델에 진입했음을 보여 줍니다.
전문가 혼합 모델은 전문가 하위 네트워크 집합과 게이팅 함수로 구성됩니다. 게이팅 함수는 전문가와 같은 입력을 받아 전문가 풀에 대한 확률 분포를 출력합니다. 점수가 가장 높은 상위 k개 전문가만 입력을 받고 출력에 기여합니다. 나머지는 해당 토큰에서 비활성 상태로 남습니다.
핵심 속성은 모듈성, 희소성, 조건부 계산입니다. 각 전문가가 서로 다른 데이터 패턴이나 작업 유형에 특화될 수 있어 모듈성이 생깁니다. 토큰당 활성 매개변수 비율이 낮아 희소성이 나타납니다. 토큰마다 활성 집합이 바뀌므로 조건부 계산이 이루어집니다.
이 속성이 MoE 모델을 밀집 트랜스포머와 구분합니다. 밀집 모델에서는 모든 가중치가 모든 순전파에 참여합니다. MoE 모델에서는 특정 토큰에 대해 대부분의 가중치가 쉬고 있습니다. 토큰당 계산량을 거의 일정하게 유지하면서 전체 용량을 높일 수 있습니다.
아키텍처는 라우터, 전문가 풀, 출력 결합이라는 세 계층으로 나뉩니다.
라우터는 입력 은닉 상태를 전문가 점수 벡터로 매핑하는 작은 선형 계층 또는 얕은 MLP입니다. 소프트맥스가 점수를 확률로 바꾸고 시스템은 이 확률에 따라 상위 k개 전문가를 선택합니다. 전체 전문가가 여덟 개 이상이어도 k는 보통 1이나 2입니다.
각 전문가는 일반적으로 표준 트랜스포머 블록의 위치별 FFN과 구조가 같은 피드포워드 네트워크입니다. 전문가들은 하나의 큰 FFN보다 작기 때문에 모델은 학습 중 메모리 예산을 넘지 않고 여러 개를 유지할 수 있습니다. 서로 다른 데이터 분포에서 온 그래디언트를 전문가별로 받으면서 학습 중 전문화가 나타납니다.
선택된 전문가의 출력에 라우터 확률을 곱해 합산합니다. 이것이 MoE 계층의 최종 기여분이 됩니다. 어텐션을 비롯한 트랜스포머 블록의 나머지 부분은 바뀌지 않습니다.
희소 활성화는 활성 매개변수 수를 낮게 유지합니다. 각각 70억 매개변수 FFN과 비슷한 크기의 전문가 여덟 개를 가진 모델도 k가 1이면 대략 70억 모델 수준의 계산만 활성화합니다. 나머지 전문가는 메모리에 있지만 해당 토큰의 행렬 곱셈에는 참여하지 않습니다.
Mixtral 8x7B는 계층마다 전문가 여덟 개를 두고 토큰당 두 개를 활성화합니다. 따라서 추론 중 활성 매개변수 수는 120억~130억 규모의 밀집 모델과 비슷하지만 전체 매개변수는 460억 개를 넘습니다. 표준 벤치마크의 여러 범주에서 Llama 2 70B보다 높은 성능을 내면서 생성 시 메모리 대역폭을 덜 사용합니다.
GPT-4도 더 많은 전문가와 더 큰 전체 매개변수를 가진 MoE 설계를 사용한다고 널리 알려져 있습니다. 공개된 세부 사항은 제한적이지만 높은 전체 용량과 통제된 추론 비용을 결합하는 패턴은 같은 원리와 맞습니다. Google의 Switch Transformer와 GLaM 같은 다른 상용 시스템도 더 큰 규모에서 동일한 구조를 따릅니다.
이 모델들의 공통 패턴은 라우터가 서로 다른 토큰 유형을 서로 다른 전문가에게 보내도록 학습한다는 점입니다. 코드 토큰은 한 전문가 집합으로, 자연어 토큰은 다른 곳으로 갈 수 있습니다. 이런 암묵적 전문화가 학습의 표본 효율성을 높입니다.
공개 가중치 채팅 모델에서 이 설계는 관리 가능한 비용으로 긴 컨텍스트를 지원합니다. 활성 메모리 사용량이 밀집 130억 모델에 가까워 사용자는 Mixtral 8x7B를 로컬이나 보급형 클라우드 GPU에서 실행할 수 있습니다. 내부 도우미를 배포하는 기업은 서빙 하드웨어를 비례해 늘리지 않고 더 높은 출력 품질을 얻습니다.
스케일링 법칙을 연구하는 그룹은 밀집 학습이 비현실적으로 되는 지점을 전체 매개변수가 넘어선 뒤에도 성능이 계속 좋아지는지 시험하기 위해 MoE를 사용합니다. Switch Transformer 논문은 보조 부하 균형 손실을 결합하면 1조 개가 넘는 매개변수를 가진 MoE 모델도 안정적으로 학습할 수 있음을 보여 줬습니다.
전문가 혼합 MoE AI에 관한 자주 묻는 질문.
질문: 같은 전체 크기의 밀집 모델보다 추론 비용을 어떻게 줄이나요?
답변: 선택된 전문가만 행렬 곱셈을 수행합니다. 라우터 비용은 작고 메모리 대역폭은 전체가 아니라 활성 가중치로 결정됩니다. 따라서 생성 속도는 활성 전문가의 크기를 따릅니다.
질문: 특별한 하드웨어가 필요한가요?
답변: 표준 GPU로 충분합니다. 효율적인 추론은 기여가 0인 전문가를 건너뛰는 커널의 도움을 받지만, 모델 가중치를 불러오면 기존 트랜스포머 런타임에서도 아키텍처가 작동합니다.
질문: 학습은 밀집 트랜스포머와 어떻게 다른가요?
답변: 전문가와 함께 라우터를 학습해야 합니다. 보조 손실이 전문가 사용량의 균형을 유지합니다. 이 항이 없으면 일부 전문가는 토큰을 거의 받지 못해 유용한 표현을 학습하지 못합니다.
질문: 밀집 모델처럼 미세 조정할 수 있나요?
답변: 가능합니다. 같은 지도 미세 조정과 선호 최적화 파이프라인을 적용합니다. 각 예시에서는 라우터와 활성 전문가만 그래디언트를 받아 역전파 중 메모리 사용량이 오히려 줄 수 있습니다.
질문: 라우터가 모든 토큰을 같은 전문가에게 보내면 어떻게 되나요?
답변: 그 전문가는 지나치게 많은 그래디언트를 받고 나머지는 충분히 학습되지 않습니다. 사전 학습 중 부하 균형 손실과 라우터 지터를 추가해 하나의 전문가로 붕괴하는 것을 막습니다.
실용적인 판단 기준은 출처와 비용, 실패 가능성을 감추지 않으면서 이 접근법이 반복 업무를 개선하는지 여부입니다. 대표적인 작업 하나로 시작하고 오류가 중요한 지점에는 사람의 확인 절차를 두며, 모델과 제품이 바뀔 때마다 결과를 다시 평가하세요.
1차 자료, 제품 문서, 실제 활용 사례를 바탕으로 해당 도구가 여러분의 업무 흐름에 맞는지 더 쉽게 판단할 수 있도록 돕습니다.