카카오 AI 모델 ‘카나나-2’, 유해성·편향성 평가서 글로벌 모델 추월
등록 2026.08.18 15:52

카나나-2 1.3B·3B, 한국어 특화 벤치마크서 젬마·큐원 앞서
35개 위험 유형 9560개 항목 평가, 유해성·편향성 등 검증

  • /카카오 제공
    /카카오 제공

    카카오는 자체 AI 안전성 평가 플랫폼을 활용해 ‘카나나-2-1.3B-인스트럭트’와 ‘카나나-2-3B-인스트럭트’의 안전성을 평가한 결과 두 모델 모두 비교 대상 가운데 가장 높은 종합 점수를 기록했다고 18일 밝혔다. 

    카나나-2는 지난 7월 27일 허깅페이스를 통해 공개됐다. 3B 모델과 이를 압축한 1.3B 모델을 중심으로 구성됐으며, 1.3B 모델에는 슬라이딩 윈도 어텐션(SWA)을 적용해 최대 3만2768토큰의 긴 문맥을 처리하면서 메모리 사용량을 줄이도록 설계됐다. 

    이번 안전성 평가는 과학기술정보통신부 사업으로 TTA, KAIST, 카카오가 공동 구축한 한국어 특화 안전성 벤치마크 ‘AssurAI’를 활용했다. AssurAI는 35개 리스크 카테고리, 9560개 평가 항목을 기반으로 AI 모델의 위험 요소를 측정한다. 카카오는 이를 사회적 리스크, 성적 콘텐츠·아동보호, 범죄·불법 행위, 폭력, 권리 침해 등 5개 영역으로 나눠 결과를 분석했다. 

    평가에는 모델의 답변을 별도의 언어모델이 정해진 기준에 따라 판정하는 ‘LLM-as-a-Judge’ 방식이 적용됐다. 대규모 항목을 동일한 기준으로 비교할 수 있도록 평가 방식을 표준화한 것이다. 카나나-2의 종합 점수는 1.3B와 3B 모델 모두 0.70이었다. 1.3B 모델은 구글 젬마의 0.68, 알리바바 큐원의 0.58보다 높았고, 3B 모델 역시 젬마 0.66, 큐원 0.62를 웃돌았다.

  • 카나나-2 안전성 평가 종합 비교. /카카오 제공
    카나나-2 안전성 평가 종합 비교. /카카오 제공

    세부 영역에서는 모델별 차이도 나타났다. 1.3B 모델은 범죄·불법 행위 영역에서 비교 모델보다 높은 평가를 받았고, 3B 모델은 성적 콘텐츠·아동보호와 권리 침해 영역에서 상대적으로 강한 결과를 보였다. 카카오는 이번 평가를 일회성 검증에 그치지 않고 자체 모델 개발 과정에 상시 적용한다는 계획이다. 

    향후에는 텍스트 모델뿐 아니라 멀티모달 모델과 AI 에이전트로 평가 대상을 넓혀 모델이 이미지·음성 등 다양한 입력을 처리하거나 외부 도구를 활용하는 과정에서 발생할 수 있는 위험까지 살필 예정이다. 카나나-2의 공개 모델 카드에서도 1.3B와 3B 모델이 실제 배포를 염두에 두고 개발됐으며, 한국어 처리와 도구 호출 등 다양한 영역의 성능을 공개하고 있다. 

    카카오 김경훈 AI 세이프티 리더는 “이번 평가는 오픈소스 모델의 안전성을 출시 전에 점검하고 그 결과를 공개했다는 데 의미가 있다”며 “앞으로도 책임 있는 AI 개발 원칙에 따라 안전성 검증을 모델 출시 과정의 핵심 단계로 정착시키겠다”고 말했다.