글로벌 모델부터 오픈소스 AI, 번역기까지 넘어서는 성능 입증
리포트는 하이퍼클로바X의 앞선 성능을 뒷받침하는 모델 학습 과정에 대해서도 설명했다. 하이퍼클로바X의 사전학습(Pretraining) 데이터는 대부분 한국어, 영어, 코드 데이터로 구성되어 있다. 양질의 사전학습 데이터 구축을 위해 매우 짧거나 반복적인 저품질 문서는 데이터셋에서 제외했고, 개인정보가 포함된 데이터도 삭제했다. 또 정렬학습(Alignment Learning)을 통해 사용자의 의도와 지시를 AI가 더 잘 이해할 수 있도록 모델을 고도화했다.
하이퍼클로바X의 또 다른 특징은 ‘다국어 능력(Multilinguality)’이다. 학습 데이터의 대부분을 차지하는 한국어와 영어 정보를 활용해 제3의 언어로 추론하는 능력을 갖춘 것이 확인됐다. 일본어, 아랍어, 힌디어, 베트남어를 비롯한 아시아 국가 언어 능력을 평가했을 때, 하이퍼클로바X는 주요 오픈소스 모델을 포함해 리포트에서 선정한 9개 모델 중 가장 높은 점수를 획득했으며, 중국어에서만 같은 모델들 중 2위를 기록했다.
테크니컬 리포트의 연구 부문을 이끈 유강민 네이버클라우드 리더는 “하이퍼클로바X의 다국어 추론, 기계 번역 능력을 측정한 실험은 지역 또는 문화권 특화 목적으로 개발한 AI가 해당 국가 언어 외에도 여러 언어에서 일정 수준 이상의 능력을 갖출 수 있음을 실증한 것”이라며 “특정 문화권에 더 적합한 배경 지식과 함께 다국어 능력까지 보유해 한층 활용도가 높은 소버린 AI의 가능성을 하이퍼클로바X가 보여주고 있다”고 강조했다.
레드티밍 등 안전한 개발 위한 노력도 진행
하이퍼클로바X의 안전성을 위한 노력도 리포트에 소개됐다. ‘사회적 이슈와 편향’, ‘불법적 행동’ 등 민감하거나 위험한 주제를 설정해 질의 데이터를 수집하고, 이를 기반으로 기술 또는 서비스의 취약점을 발견하고 검증하기 위해 의도적으로 공격을 시도하는 레드티밍(Red-teaming)을 수행해 모델 취약점을 보완했다. 또 하이퍼클로바X 윤리 원칙에 기반해 혐오, 편향, 저작권 침해, 개인정보 등의 콘텐츠는 생성하지 않도록 지속적으로 개선하고 있다.
테크니컬 리포트는 학습 방법이나 성능 등 AI 모델의 세부 정보를 소개하는 논문이다. 오픈AI, 구글과 같은 빅테크 기업들도 자사 AI의 특징을 테크니컬 리포트를 통해 설명하고 있다.
이번 하이퍼클로바X 테크니컬 리포트에서는 한국어, 영어, 수학, 코딩, 상식, 사실성, 안전성 등 여러 분야에서 하이퍼클로바X 및 비교군 모델들의 성능 평가가 이뤄졌으며, 각 분야의 성능 측정에는 신뢰성 있는 평가 체계(벤치마크, Benchmarks)들을 인용하거나 자체 개발한 평가 지표를 활용했다.
예를 들어 하이퍼클로바X와 오픈소스 모델들의 한국어 능력을 측정하기 위해, 한국판 AI 시험으로 알려진 ‘KMMLU(Measuring Massive Multitask Language Understanding in Korean)’, 글로벌 AI 언어 이해 능력 평가 ‘MMLU(Measuring Massive Multitask Language Understanding)’, 마이크로소프트가 개발한 AI 성능 평가 ‘AGIEval(Artificial General Intelligence Evaluation)’ 등 6개의 벤치마크 점수를 종합해 결과를 도출했다.