본문 바로가기
기획/이슈

[연속기획④] 독자 AI 1차 평가 1위, LG 모델의 기술적 정합성을 짚다

LG AI연구원은 독자 AI 파운데이션 모델 1차 단계평가에서 AI Frontier·Diffusion 지표 모두 최고점을 기록했으며, K-EXAONE의 구조와 학습 규모는 정부 평가 체계와 결과적으로 정합성을 보였다.

[연속기획④] 독자 AI 1차 평가 1위, LG 모델의 기술적 정합성을 짚다

1월 중순 발표된 독자 AI 파운데이션 모델 1차 단계평가 결과에서 LG AI연구원은 최고점을 기록했다. 그러나 이 결과를 단순 순위 경쟁으로 해석하는 것은 충분하지 않다. 이번 평가는 AI Frontier Index와 AI Diffusion Index라는 두 축으로 설계됐다. 세계적 수준 도달 여부와 산업 확산 가능성을 동시에 검증하는 구조다. LG 모델이 이 두 영역에서 모두 최고 평가를 받은 배경에는 K-EXAONE의 기술 구조가 있다.

독자 AI 파운데이션 모델 1차 단계평가 구조와 K-EXAONE 아키텍처의 정합성을 상징적으로 표현 (생성이미지제작:데일리뉴스)
독자 AI 파운데이션 모델 1차 단계평가 구조와 K-EXAONE 아키텍처의 정합성을 상징적으로 표현 (생성이미지제작:데일리뉴스)

먼저 AI Frontier Index는 글로벌 공통 벤치마크 13종과 글로벌 타깃 모델과의 개별 비교 평가, 그리고 수학·지식·장문 이해·안전성 등을 포함하는 공통 벤치마크로 구성된다. 이는 특정 단일 영역 우위가 아니라 다영역 균형 성능을 요구하는 체계다. LG AI연구원은 벤치마크 총점에서 가장 높은 점수를 기록했고, 글로벌 개별 비교 평가에서도 만점을 획득했다.

이 평가 구조와 연결되는 기술적 기반이 K-EXAONE이다. 총 236B 파라미터 규모의 Mixture-of-Experts (MoE) 구조는 전체 128개 전문가 중 추론 시 8개와 1개의 공유 전문가만 활성화하는 방식이다. 대형 모델 수준의 표현력을 유지하면서도 실제 연산량은 23B 활성 파라미터 수준으로 제한된다. 이는 글로벌 최상위 모델과의 직접 비교가 가능한 규모를 확보하면서도 운용 효율을 고려한 설계다.

256K 컨텍스트 지원 역시 Frontier 지표와 맞닿는다. 장문 이해와 복합 문서 추론은 최근 글로벌 벤치마크의 핵심 요구 조건이다. Hybrid Attention 구조는 이러한 요구에 대응하는 기술적 장치다. 11조 토큰 규모의 사전학습은 수학·지식·코딩·안전성 등 다영역 일반화 능력을 확보하기 위한 학습 스케일이다. 이는 글로벌 비교 평가를 전제로 한 기술적 기반으로 볼 수 있다.

AI Diffusion Index는 사용자 평가와 실제 활용 가능성을 본다. LG AI연구원은 사용자 평가에서 만점을 기록했다. 이와 연결되는 설계 요소는 추론 효율 구조다. MoE 기반으로 활성 파라미터를 제한함으로써 대형 모델의 성능을 유지하면서도 서빙 비용을 관리할 수 있도록 했다. Reasoning 모드와 non-reasoning 모드를 분리해 제공하는 점 역시 실제 서비스 환경을 고려한 구조다.

Hugging Face에 공개된 K-EXAONE은 Transformers 환경과 vLLM, TensorRT-LLM, SGLang, llama.cpp 등 주요 서빙 스택을 지원한다. 이는 연구 단계에 머무르지 않고 산업 환경으로 이전 가능한 구조임을 의미한다.

중요한 점은 EXAONE 계열이 독자 AI 과제 이전부터 개발돼 온 모델이라는 사실이다. EXAONE 1.0은 2021년 공개됐고, 이후 2.0, 3.0, 4.0으로 확장돼 왔다. 독자 AI 파운데이션 모델 사업은 2025년 6월 공모로 시작됐다. 시간 순으로 보면, 장기간 축적된 모델 개발 역량이 과제에 참여했고, 정부 평가 체계는 이를 검증하는 장치로 작동했다.

기존 EXAONE 계열의 기술 방향이 정부 평가 지표와 결과적으로 정합성을 보였다는 것이다. Frontier 지표는 학습 규모와 아키텍처 확장을 요구했고, Diffusion 지표는 추론 효율과 서빙 생태계를 요구했다. K-EXAONE은 이 두 요구 조건을 동시에 충족하는 구조를 갖고 있었다.

1차 단계평가 최고점은 특정 과제 대응 설계의 산물이라기보다, 장기간 축적된 대형 언어모델 개발 역량이 국가 평가 체계에서 검증된 사례로 해석하는 것이 타당하다. 기술 구조와 정책 지표가 교차한 지점에서 K-EXAONE의 위치가 드러난다.

이 기사를 추천합니다

i

댓글

0

후 댓글을 작성할 수 있습니다.

아직 댓글이 없습니다 이 기사에 첫 의견을 남겨보세요.