Earticle

현재 위치 Home

한국어 문서 검색에서 키워드 기반 검색과 의미 기반 검색의 성능 비교 연구
A Comparative Study on the Performance of Keyword-Based and Semantic-Based Retrieval in Korean Document Search

첫 페이지 보기
  • 발행기관
    한국융합학회 바로가기
  • 간행물
    미래기술융합논문지 KCI 등재후보 바로가기
  • 통권
    제5권 제2호 (2026.04)바로가기
  • 페이지
    pp.1-6
  • 저자
    최혜림, 김태국
  • 언어
    한국어(KOR)
  • URL
    https://www.earticle.net/Article/A484338

※ 기관로그인 시 무료 이용이 가능합니다.

4,000원

원문정보

초록

영어
This study aims to empirically examine whether Dense Retrieval methods, primarily developed in English-centric research environments, are effective for Korean document retrieval, considering the agglutinative nature of the language and the complexity of morphological analysis. Using the KLUE-MRC benchmark dataset (5,841 queries and 15,797 documents), we evaluated BM25, Ko-SRoBERTa, KoE5, a fine-tuned KoE5, and a hybrid approach (combining BM25 and KoE5) based on Recall@5/10, MRR@10, and nDCG@10 metrics. The experimental results show that KoE5-based Dense Retrieval achieved an nDCG@10 score of 0.718, outperforming the traditional BM25 (0.567) by approximately 15 percentage points. Furthermore, fine-tuning KoE5 on the KLUE-MRC training set further improved performance to an nDCG@10 score of 0.739. In contrast, Ko-SRoBERTa performed worse than BM25, confirming that retrieval performance can vary significantly depending on model quality and training objectives, even within the Dense Retrieval paradigm. The hybrid method achieved the best Recall@10 (0.841), demonstrating the complementary potential of combining lexical and semantic search. These findings suggest that, when constructing Korean document retrieval systems, selecting optimized models according to domain characteristics and application goals is more critical than merely choosing a retrieval paradigm.
한국어
본 연구는 한국어의 교착어적 특성과 형태소 분석의 복잡성을 고려하여, 영어 중심으로 발전한 밀집 검색(Dense Retrieval) 방식이 한국어 문서 검색 환경에서도 유효한지 실증적으로 검증하였다. 이를 위해 KLUE-MRC 벤치마크 데이터셋(질의 5,841건, 문서 15,797건)을 활용하여 전통적인 키워드 기반 방식인 BM25와 의미 기반인 Ko-SRoBERTa, KoE5, 그리고 이들을 결합한 하이브리드 방식의 성능을 다각도로 평가하였다. 실험 결과, KoE5 기반 밀집 검색이 nDCG@10 기준 0.718로 우수한 성능을 기록하며 BM25(0.567) 대비 약 15%p의 성능 우위를 보였다. 그리고 KLUE-MRC 학습 데이터를 활용한 KoE5 파인튜닝을 통해 nDCG@10 기준 0.739로 성능이 더욱 향상됨을 확인하였다. 반면, Ko-SRoBERTa는 BM25보다 낮은 성능을 기록하여 밀집 검색 모델이라 할지라도 모델의 품질과 학습 목적에 따라 성능 역전이 발생할 수 있음을 확인하였다. 한편, 하이브리드 방식은 Recall@10(0.841)에서 최고치를 달성하며 두 방식의 상호보완적 가능성을 입증하였다. 본 연구의 결과는 향후 한국어 검색 시스템 구축 시 단순한 방법론 채택보다 도메인 특성 및 응용 목적에 최적화된 모델 선택이 필수적임을 시사한다.

목차

요약
Abstract
1. 서론
2. 관련 연구
2.1 키워드 기반 검색: BM25
2.2 Dense Retrieval
2.3 하이브리드 검색
3. 연구 방법
3.1 데이터셋
3.2 비교 모델
3.3 실험 환경
3.4 평가 지표
4. 실험 결과 및 분석
4.1 전체 성능 비교
4.2 분석
5. 결론
REFERENCES

저자

  • 최혜림 [ Hye-Rim Choi | 국립부경대학교 인공지능융합학과 학생 ]
  • 김태국 [ Tae-Kook Kim | 국립부경대학교 컴퓨터·인공지능공학부 교수 ] Corresponding Author

참고문헌

자료제공 : 네이버학술정보

간행물 정보

발행기관

  • 발행기관명
    한국융합학회 [Korea Convergence Society]
  • 설립연도
    2011
  • 분야
    복합학>학제간연구
  • 소개
    본회는 융합학문 및 융합기술을 교류를 통한 학문기술의 확대․발전․보급 및 기술개발 전략에 과학적으로 접근하여 융합학문 및 기술을 더욱 활성화하고, 회원 상호간의 정보 교류를 도모함으로써 지역과 나라발전에 기여함을 목적으로 한다.

간행물

  • 간행물명
    미래기술융합논문지
  • 간기
    격월간
  • eISSN
    2951-2468
  • 수록기간
    2022~2026
  • 등재여부
    KCI 등재후보
  • 십진분류
    KDC 530 DDC 620

이 권호 내 다른 논문 / 미래기술융합논문지 제5권 제2호

    피인용수 : 0(자료제공 : 네이버학술정보)

    함께 이용한 논문 이 논문을 다운로드한 분들이 이용한 다른 논문입니다.

      페이지 저장