DBRX: 세분화된 MoE로 공개 모델 효율 경쟁에 합류하다
Databricks가 132B 전체 파라미터 중 36B를 활성화하는 MoE 언어 모델 DBRX를 공개했다.
한 문장 요약: Databricks가 132B 전체 파라미터 중 36B를 활성화하는 MoE 언어 모델 DBRX를 공개했다.
무엇이 발표됐나
Databricks의 공식 발표일은 2024-03-27다. 이날 공개된 DBRX의 핵심은 다음과 같다. 기본·지시 모델 가중치와 학습 관련 자료를 공개하고 Mosaic AI 플랫폼에서 바로 사용할 수 있게 했다.
기술적으로 볼 지점
16개 전문가 중 4개를 활성화하는 세분화된 MoE, 회전 위치 임베딩, gated linear unit을 조합해 품질과 추론 효율을 노렸다.
왜 중요했고, 무엇을 경계해야 하나
데이터 플랫폼 기업도 자체 기반 모델을 공개하면서 기업 데이터와 모델 학습·서빙을 한 플랫폼에서 잇는 경쟁이 강화됐다.
오픈 가중치이지만 132B 규모 운영에는 여전히 큰 메모리와 분산 추론 역량이 필요했고 라이선스 조건도 확인해야 했다.
이 글은 발표 당시의 핵심을 빠르게 확인하기 위한 브리핑이다. 수치와 제공 범위는 아래 1차 출처를 기준으로 정리했으며, 별도의 직접 벤치마크를 수행했다는 의미는 아니다.
공식 1차 출처
- Introducing DBRX — Databricks, 2024-03-27
관련 포스트
Mixtral 8x22B: 더 큰 희소 MoE를 오픈 가중치로
Mistral AI가 8개 전문가 중 2개를 활성화하는 대형 희소 MoE 모델 Mixtral 8x22B를 공개했다.
K-EXAONE 2.0: 기존 MoE를 750B로 업사이클링하다
LG AI Research가 기존 K-EXAONE을 깊이와 전문가 축으로 확장한 750B·37B 활성 오픈 웨이트 모델 K-EXAONE 2.0을 공개했다.
Llama 3 8B·70B: 15조 토큰으로 다시 세운 공개 모델 기준
Meta가 8B와 70B 크기의 Llama 3 사전학습·지시조정 모델을 공개했다.