Mistral Moderation API: 안전 분류도 다국어 모델로
Mistral AI가 텍스트를 여러 위험 범주로 분류하는 전용 Moderation API를 공개했다.
브리핑작성 coyaSONG
0 views
Mistral AIAI SafetyAPI
공유하기:
한 문장 요약: Mistral AI가 텍스트를 여러 위험 범주로 분류하는 전용 Moderation API를 공개했다.
무엇이 발표됐나
Mistral AI의 공식 발표일은 2024-11-07다. 이날 공개된 Mistral Moderation API의 핵심은 다음과 같다. 자체 대화 제품에서 쓰던 분류 모델을 API로 제공하고 다국어 입력의 정책 적용을 지원했다.
기술적으로 볼 지점
생성 모델과 분리된 경량 분류 모델이 입력·출력을 카테고리별 점수로 평가해 정책 계층을 구성한다.
왜 중요했고, 무엇을 경계해야 하나
안전 필터가 영어 중심 키워드 규칙에서 문맥을 이해하는 다국어 모델 서비스로 발전했다.
공급자 기본 분류는 서비스의 고유 정책·지역 규제를 모두 대변하지 않으며 오탐·누락에 대한 자체 평가가 필요했다.
이 글은 발표 당시의 핵심을 빠르게 확인하기 위한 브리핑이다. 수치와 제공 범위는 아래 1차 출처를 기준으로 정리했으며, 별도의 직접 벤치마크를 수행했다는 의미는 아니다.
공식 1차 출처
- Mistral Moderation — Mistral AI, 2024-11-07
관련 포스트
AI
Shieldstral: 자연어 정책으로 바꾸는 멀티모달 가드레일
Mistral AI가 런타임 자연어 정책에 따라 텍스트와 이미지를 판정하는 3B급 오픈 웨이트 안전 분류기 Shieldstral을 공개했다.
AI
Mistral Large와 Le Chat: 유럽발 프런티어 모델 경쟁
Mistral AI가 상용 플래그십 Mistral Large와 대화형 제품 Le Chat을 공개했다.
AI
Mixtral 8x22B: 더 큰 희소 MoE를 오픈 가중치로
Mistral AI가 8개 전문가 중 2개를 활성화하는 대형 희소 MoE 모델 Mixtral 8x22B를 공개했다.