과학기술정보통신부의 독자 AI 파운데이션 모델 2차 단계평가에서 업스테이지와 SK텔레콤, LG AI연구원이 다음 단계 진출팀으로 선정됐다. Motif Technologies의 Motif 3는 글로벌 범용 성능을 측정하는 Artificial Analysis Intelligence Index(AAII)에서 정예팀 가운데 가장 높은 점수를 받았지만 종합평가 결과에서는 진출팀에 포함되지 않았다.
두 결과의 차이는 AAII가 종합평가를 구성한 여러 항목 가운데 하나였다는 평가 구조에서 비롯됐다. 다음 단계 진출팀은 AAII와 NIA 벤치마크, 전문가 평가, 사용자 평가를 합산한 종합점수로 선정됐다.
AAII 최고점은 종합평가의 25점 항목
AAII는 Artificial Analysis가 에이전트 수행 능력과 코딩, 과학적 추론, 범용 능력 등을 평가한 여러 벤치마크를 종합해 산출하는 지표다. 독자 AI 파운데이션 모델 2차 단계평가에서는 정예팀 모델 가운데 Motif 3가 AAII에서 가장 높은 점수를 기록했다.
AAII에는 종합평가 100점 가운데 25점이 배정됐다. 나머지는 NIA 벤치마크 15점, 전문가 평가 35점, 사용자 평가 25점으로 구성됐다. Motif 3의 AAII 최고점은 글로벌 범용 역량을 평가한 항목에서 거둔 성과이며, 다음 단계 진출팀은 네 항목을 합산한 종합점수로 결정됐다.
NIA는 한국어·지시 이행·안전성까지 평가
NIA 벤치마크에는 종합평가 100점 가운데 15점이 배정됐다. 과기정통부가 공개한 평가 분야는 수학, 지식, 장문 이해, 지시 이행, 한국어, 안전성, 신뢰성 등 7개다. 글로벌 범용 성능을 측정하는 AAII와 함께 한국어 능력과 지시 수행, 안전성·신뢰성을 종합평가에 반영했다.
1차 단계평가에서 NIA 벤치마크의 배점은 10점이었다. 당시에는 수학, 지식, 장문 이해와 함께 AI안전연구소가 참여한 안전성·신뢰성 평가가 진행됐다. 2차 평가에서는 배점이 15점으로 늘고 지시 이행과 한국어 분야가 포함됐다.
NIA 평가의 세부 문항과 분야별 배점, 채점 방식, 팀별 점수는 공개되지 않았다.
기술·생태계·사용성에 60점 배정
전문가 평가에는 35점이 배정됐다. AI 알고리즘과 서비스, 데이터 분야 전문가 10명이 기술·개발 성과와 생태계 기여도를 평가했다. 과기정통부는 독자 기술을 활용한 모델 성능 향상 수준과 국내외 AI 생태계에 미칠 파급효과, 기여계획 등을 평가에 반영했다고 밝혔다.
사용자 평가는 전문 사용자만 참여했던 1차 평가와 달리 일반 국민 평가가 추가됐다. 전문 사용자 평가에는 15점, 일반 국민 평가에는 10점이 배정됐다. AI 스타트업 대표 등을 포함한 전문 사용자 49명과 일반 국민 185명은 각 정예팀 모델을 적용한 웹사이트를 직접 이용한 뒤 사용성을 5점 척도로 평가했다.
314B 규모 MoE로 개발된 Motif 3
Motif Technologies의 모델카드와 기술보고서에 따르면 Motif 3는 총 314B(3140억)개의 매개변수를 갖춘 혼합전문가모델(Mixture of Experts·MoE)이다. 각 MoE 계층에는 384개의 전문가가 배치됐으며, 입력 토큰마다 이 가운데 8개를 선택해 약 13.2B(132억)개의 매개변수를 활성화한다.
MoE는 입력에 필요한 일부 전문가만 선택적으로 사용하는 구조다. Motif 3도 전체 314B 매개변수를 매번 모두 활성화하는 대신 토큰별 연산에 참여하는 매개변수를 줄였다. 전체 매개변수와 활성 매개변수를 구분해 봐야 하는 이유다.
Motif 3는 최대 256K 토큰의 컨텍스트를 지원하며 웹 문서와 과학·기술 분야 자료, 코드, 수학, 다국어 및 전문 분야 자료를 포함한 약 12.5조개 토큰으로 사전학습됐다. 모델 가중치는 상업적 이용과 수정·배포를 허용하는 MIT 라이선스로 공개됐다.
평가의 폭만큼 결과 설명도 구체화해야
Motif 3는 AAII에서 정예팀 최고점을 기록했지만 다음 단계 진출팀은 네 개 평가 항목을 합산한 종합점수로 선정됐다. 과기정통부는 최종 진출팀과 평가체계는 공개했으나 항목별 팀 점수는 밝히지 않았다. 이에 따라 NIA 벤치마크와 전문가·사용자 평가가 최종 결과에 각각 어느 정도 영향을 미쳤는지는 공개된 자료만으로 확인하기 어렵다.
평가 문항과 정답을 공개하지 않더라도 평가 영역별 점수와 판단 기준을 어느 수준까지까지 제시할 수 있는지는 검토할 필요가 있다. 결과에 대한 구체적인 설명은 참여팀이 모델의 보완 방향을 설정하고, 기업과 연구기관이 각 모델의 기술적 특성과 활용 가능성을 판단하는 데 필요한 정보이기 때문이다.
자료출처=과학기술정보통신부 ‘독자 AI 파운데이션 모델 프로젝트 2차 단계평가 결과’, 과학기술정보통신부 ‘독자 AI 파운데이션 모델 프로젝트 1차 단계평가 결과’, Motif Technologies ‘Motif 3’ 모델카드, Motif 3 기술보고서, Artificial Analysis Intelligence Index, Artificial Analysis 벤치마크 산정 방법



















댓글
0