Asset 2

팀스파르타, 국가 공인 평가 K-AI 리더보드 최고 난도 추론 1위

초경량 모델로 131배 큰 대형 모델 제치고 최고점 기록

[아이뉴스24 문영수 기자] 팀스파르타(대표 이범규)는 자체 개발한 초경량 언어모델 'K-AX 스파르탄 1.8B'가 과학기술정보통신부와 한국지능정보사회진흥원(NIA)이 운영하는 'K-AI 리더보드'의 초고난도 추론 평가인 'HLE(Ko)' 분야에서 단독 1위를 차지했다고 밝혔다.

이번 성과는 대형 모델 중심의 AI 시장에서 독자적인 초경량 모델의 압도적인 효율성과 고난도 추론 성능을 입증했다는 점에서 의의가 크다고 회사 측은 강조했다.

[사진=팀스파르타]

HLE(Humanity's Last Exam)는 미국 AI안전센터와 스케일AI가 공동 개발한 초고난도 AI 추론 벤치마크다. 수학, 과학, 인문학 등 100여개 분야 전문가가 출제한 2500개 문항으로 구성됐으며 K-AI 리더보드의 핵심 평가 지표 중 하나다.

K-AX 스파르탄 1.8B은 HLE(Ko) 평가에서 0.123점을 기록하며 2위 모델(0.077점) 대비 4.6%포인트, 약 60% 높은 성능을 보였다. 10위권 모델 대부분이 0.068~0.077점대에 분포한 가운데 단독 선두에 오른 것이다.

18억개 파라미터의 초경량 모델이 수백억에서 수천억개 규모의 대형 모델들을 제친 결과로, 상위 10개 모델의 평균(약 38.7B)과 비교하면 20분의 1 크기로 거둔 성과다. 특히 236B급 모델 대비 파라미터는 131분의 1에 불과하지만, 점수는 두 배 이상 높았다고 회사 측은 강조했다.

팀스파르타는 검증된 방법론을 대형화해 주력 프런티어 모델 'K-AX 스파르탄 122B'를 완성했다. 양자화(경량화) 기술을 적용해 기업 내부 장비에서도 운용된다. 122B를 엔진으로 쓰는 'AX Fortress(포트리스)'는 인터넷과 분리된 폐쇄망에서 작동하는 AI 코딩 에이전트다. 소스코드와 내부 데이터를 외부로 보내지 않고 코드 생성, 자동완성, 검토부터 빌드, 테스트, 배포 도구 호출까지 수행하며, 자동완성 응답 속도는 워크스테이션 한 대 기준 0.3초 미만으로 실측됐다.

이범규 팀스파르타 대표는 "이번 1위는 팀스파르타의 독자적인 설계와 학습 기술만으로 세계적 수준의 추론 성능을 구현할 수 있음을 입증한 결과"라며 "검증된 기술을 적용한 K-AX 스파르탄 122B와 AX 포트리스를 기반으로 보안과 생산성이 함께 필요한 기업의 실질적인 AX를 적극 지원하겠다"고 말했다.

/문영수 기자(mj@inews24.com)