인공지능 언어 성능에 대한 논의는 여전히 대부분 영어에 집중되어 있습니다. 모델이 표준 벤치마크에서 높은 점수를 받으면 최첨단 기술로 칭송받고 전 세계적으로 보급됩니다. 그러나 최근 유럽연합 집행위원회의 새로운 EU MMLU 데이터셋을 비롯한 여러 연구 결과는 영어 성능이 우수하다고 해서 프랑스어, 헝가리어, 몰타어를 얼마나 잘 처리하는지 제대로 알 수 없다는 것을 보여줍니다. 국제 행사에서 인공지능 실시간 번역 에 의존하는 사람들에게 이러한 격차는 단순한 학술적 문제가 아닙니다. 참석자가 기조연설을 이해할 수 있느냐, 아니면 전혀 이해하지 못하느냐의 차이로 직결되는 문제입니다.
이는 대규모 언어 모델(LLM)을 평가하는 데 사용되는 벤치마크가 어떤 시스템이 배포되고 신뢰받을지를 결정하기 때문에 중요합니다. 만약 이러한 벤치마크가 거의 전적으로 영어로만 구축되었다면, AI 실시간 번역 서비스의 주요 사용자들이 사용하는 언어를 포함하여 다른 모든 환경에서 모델의 성능을 제대로 파악할 수 없습니다.
EU MMLU 벤치마크란 무엇인가
EU MMLU는 유럽연합 집행위원회 번역총국(DG Translation)에서 발표한 새로운 다국어 벤치마킹 데이터셋입니다. 이 데이터셋은 대규모 다중 작업 언어 이해(MMLU)하며, 과학, 법률, 윤리, 공공 문제 등 57개 주제에 걸쳐 수천 개의 객관식 문항을 통해 모델의 성능을 테스트합니다.
EU MMLU는 이 프레임워크를 EU 환경에 맞게 특별히 적용했습니다. 유럽 기관과의 관련성을 고려하여 선정된 7개 주제 영역에 중점을 두고 있으며, 현재 크로아티아어, 체코어, 네덜란드어, 프랑스어, 독일어, 그리스어, 헝가리어, 아일랜드어, 이탈리아어, 리투아니아어, 폴란드어, 포르투갈어, 루마니아어, 슬로바키아어, 슬로베니아어를 포함한 16개 EU 공식 언어를 지원하고 있으며, 향후 더 많은 언어를 지원할 계획입니다. 이 프로젝트는 기존 영어 문제를 단순히 번역하는 대신, 모든 언어 버전에서 동일한 의미, 난이도 및 평가 가치를 유지하는 것을 목표로 삼았습니다. 따라서 폴란드어 점수는 프랑스어 점수와 동일한 의미를 갖습니다.
모델이 영어에는 뛰어나지만 다른 분야에서는 어려움을 겪는 이유는 무엇일까요?
대부분의 AI 평가 데이터 세트는 영어로 구축되었으며 영어권의 교육, 문화 및 사회적 맥락을 반영합니다. 영어 데이터로 주로 학습 및 테스트된 모델은 매우 뛰어난 성능을 보이는 것처럼 보일 수 있지만, 다른 언어에서의 실제 성능은 제대로 측정되지 않는 경우가 많습니다.
이것이 바로 DG Translation이 해소하고자 했던 격차입니다. EU MMLU 발표에서 언급했듯이, 모델은 영어에서는 좋은 점수를 받지만 프랑스어, 헝가리어 또는 몰타어에서는 현저히 저조한 성능을 보일 수 있습니다. 근본적인 문제는 모델이 다른 언어를 전혀 처리할 수 없다는 것이 아닙니다. 표준 벤치마크는 모델의 약점을 드러낼 만큼 충분히 엄격하게 테스트하지 않기 때문에 문법, 뉘앙스 또는 전문 용어에서의 약점이 실제 사용자가 결과물에 의존할 때까지 눈에 띄지 않는다는 것입니다.
특히 AI 실시간 번역의 경우, 이러한 들쭉날쭉한 성능은 직접적인 결과를 초래합니다. 시스템이 직관적인 영어 원문은 잘 처리하지만, 동일한 내용을 검증이 덜 된 대상 언어로 번역할 때 오류, 어색한 표현, 의미 누락 등을 발생시킬 수 있습니다. 바로 실시간으로 내용을 듣는 청취자에게 정확성이 가장 중요한 순간이죠.
언어적, 문화적 편견이 실시간 번역에 나타나는 방식
언어 성능 격차는 문제의 일부일 뿐입니다. 유럽연합 번역총국(DG Translation)은 번역 정확도를 넘어 AI 모델이 EU 가치를 얼마나 잘 반영하고 관용구, 유머, 참조, 날짜 및 숫자 형식, 예상되는 어조나 공손함의 차이 등 문화적 특수성을 얼마나 잘 처리하는지까지 평가하는 다국어 벤치마킹 품질 기준을 발표했습니다.
바로 이러한 요소들이 실시간 번역을 진정으로 어렵게 만드는 원인입니다. 지역 방언, 문화적 특수성, 또는 현지 관습에 따른 격식을 사용하는 발표자는 단순히 단어 하나하나를 직역하는 것 이상의 것을 고려해야 합니다. 특정 언어의 이러한 미묘한 뉘앙스를 접해보지 못한 AI 시스템은 단어 자체는 정확하게 번역할 수 있지만, 의도된 의미나 어조를 완전히 놓칠 수 있습니다. 다국어 행사에서 이러한 차이는 청중 중 일부에게 메시지가 전달되는 방식에 영향을 미칠 수 있으며, 심지어 아무도 기술적인 오류를 알아차리지 못하는 경우에도 마찬가지입니다.
사람이 검토한 다국어 데이터가 여전히 중요한 이유
EU MMLU의 가장 주목할 만한 특징 중 하나는 방법론입니다. 대부분의 다국어 시험이 비영어권 시험 문제를 생성하기 위해 주로 기계 번역에 의존하는 것과는 달리, EU MMLU는 인간 중심적인 접근 방식을 채택했습니다. 유럽 번역총국(DG Translation)은 유럽 전역 21개 대학에서 선발된 유럽 번역 석사(EMT) 네트워크 소속 학생 번역가 및 프로젝트 관리자 약 250명과 협력하여 1,000개 이상의 시험 문제를 번역하고 검토했습니다.
이러한 차이점은 생각보다 훨씬 중요합니다. 기계 번역을 통해 구축된 벤치마크는 본래 드러내고자 했던 약점을 그대로 물려받을 위험이 있습니다. 즉, 모델의 출력 결과를 다른 모델의 출력 결과와 비교하는 데 그치고, 진정한 인간의 기준과 비교하지 않기 때문입니다. 인간의 검토는 사람들이 실제로 언어를 사용하는 방식을 기준으로 평가를 진행하며, 이는 청중이 사람이고 미묘한 오역에 대한 허용치가 낮은 실제 행사에서의 실시간 번역에 가장 중요한 기준이기도 합니다.
보다 공정한 AI 평가가 다국어 행사에 미칠 수 있는 영향은 무엇일까요?
DG Translation은 장기적인 목표를 명확히 제시합니다. 유럽에서 다국어 AI 평가를 위한 새로운 기준을 확립하여 AI 시스템이 영어권 환경이 아닌 다양한 언어와 문화권에서 일관된 성능을 발휘하도록 하는 것입니다. 이러한 목표가 실현된다면 실질적인 이점은 연구실을 훨씬 넘어설 것입니다.
국제 회의, 기관 회의 또는 글로벌 기업 행사를 주최하는 조직의 경우, 향상된 다국어 벤치마킹은 특정 AI 시스템이 어떤 언어에서 신뢰할 수 있는지 명확하게 파악할 수 있도록 해줍니다. 행사 도중에 특정 도구가 영어 이외의 언어에서 성능이 저하된다는 사실을 발견하는 것보다 훨씬 효과적입니다. 이를 통해 AI 기반 실시간 번역이 신뢰할 수 있는 영역과 AI와 인간 통역을 결합한 하이브리드 방식이 특정 언어 또는 청중에게 의미와 뉘앙스를 더 잘 전달하는 영역에 대해 더욱 정보에 입각한 결정을 내릴 수 있습니다.
EU MMLU와 같은 벤치마크가 다국어 AI의 모든 격차를 단숨에 해결해 주지는 않겠지만, 성능 측정 및 전달 방식에 의미 있는 변화를 가져올 것입니다. 이러한 평가 기준이 성숙해짐에 따라 행사 주최자, 기관 및 홍보팀은 진정한 다국어 사용자를 위한 AI 실시간 번역 솔루션을 선택하는 데 더욱 명확한 기준을 갖게 될 것입니다. Interprefy가 다양한 언어에 걸쳐 AI 실시간 번역을 어떻게 구현하는지 알아보려면 당사의 AI 음성 번역 플랫폼을.


추가 다운로드 링크



