Earticle

현재 위치 Home 검색결과

결과 내 검색

발행연도

년 - 년

학문분야

자료유형

간행물

검색결과

검색조건
검색결과 : 4건
No
1

본 연구는 한국어 검색 증강 생성(RAG) 시스템에서 청킹 전략이 검색 품질과 답변 정확도에 미치는 영향을 분석하 였다. KorQuAD 데이터셋 기반 612개 위키피디아 문서와 1,500개 질의응답 쌍을 활용하여 고정 크기 청킹과 문 장 단위 청킹을 비교 평가하였다. 실험 결과, 200자 고정 청킹이 답변 정확도 68.8%로 가장 우수한 성능을 보였 다. 청크 크기 증가에 따라 의미 유사도는 향상되었으나, 300자 이후 답변 정확도는 감소하여 검색 성능 향상이 생 성 성능으로 직결되지 않는 검색–답변 괴리 현상이 확인되었다. 문장 단위 청킹은 가장 낮은 성능을 기록하였다. 본 연구는 한국어 추출형 질의응답 기반 RAG 시스템에서 검색 품질과 생성 성능 간의 괴리를 실증적으로 규명하 고, 청킹 전략 설계를 위한 정량적 기준을 제시한다.

This study analyzes the impact of chunking strategies on retrieval quality and answer accuracy in Korean retrieval-augmented generation (RAG) systems. Using 612 Wikipedia documents from the KorQuAD dataset and 1,500 question–answer pairs, fixed-size chunking strategies and sentencelevel chunking were comparatively evaluated. Experimental results show that 200-character fixedsize chunking achieves the highest answer accuracy of 68.8%. While semantic similarity improves as chunk size increases, answer accuracy declines beyond 300 characters, revealing a retrieval– generation discrepancy in which improved retrieval performance does not directly translate into better generation outcomes. Sentence-level chunking exhibits the lowest performance among the evaluated strategies. This study empirically elucidates the gap between retrieval quality and generation performance in Korean extractive question-answering–based RAG systems and provides quantitative design guidelines for effective chunking strategies.

2

고차원 멀티미디어 데이터 검색을 위한 벡터 근사 비트맵 색인 방법

황지익, 손대온, 낭종호

[Kisti 연계] 한국정보과학회 한국정보과학회 학술대회논문집 2005 pp.46-48

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

기존의 다차원 색인 기법들이 고차원의 특징 벡터를 갖는 멀티미디어 컨텐츠 검색 분야에서 만족할 만한 성능을 보이지 못하므로, 이를 해결하기 위해 VA-File, LPC-File 등의 벡터 근사 방법이 개발 되었다. 이러한 방법들은 데이터의 접근에 소요되는 시간이 전체 검색시간의 대부분을 차지하는 경우에 효과적으로 사용할 수 있다. 그러나 고차원의 멀티미디어 데이터 검색에서 객체간의 거리 계산 시간은 데이터 접근 시간에 비해 무시할 만큼 작지 않으므로 이 방법들을 그대로 적용하기는 어렵다. 본 논문에서는 객체간의 거리 계산 시간을 줄이기 위한 새로운 색인 기법을 제안하고 실험을 통해 이 방법이 기존의 방법들에 비해 우수한 검색 성능을 가진다는 것을 보인다.

3

고차원 멀티미디어 데이터 검색을 위한 벡터 근사 비트맵 색인 방법

황지익, 손대온, 낭종호

[Kisti 연계] 한국정보과학회 한국정보과학회 학술대회논문집 2005 pp.46-48

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

기존의 다차원 색인 기법들이 고차원의 특징 벡터를 갖는 멀티미디어 컨텐츠 검색 분야에서 만족할 만한 성능을 보이지 못하므로, 이를 해결하기 위해 VA-File, LPC-File 등의 벡터 근사 방법이 개발 되었다. 이러한 방법들은 데이터의 접근에 소요되는 시간이 전체 검색시간의 대부분을 차지하는 경우에 효과적으로 사용할 수 있다. 그러나 고차원의 멀티미디어 데이터 검색에서 객체간의 거리 계산 시간은 데이터 접근 시간에 비해 무시할 만큼 작지 않으므로 이 방법들을 그대로 적용하기는 어렵다. 본 논문에서는 객체간의 거리 계산 시간을 줄이기 위한 새로운 색인 기법을 제안하고 실험을 통해 이 방법이 기존의 방법들에 비해 우수한 검색 성능을 가진다는 것을 보인다.

4

동적 경로안내시스템에서 벡터 지오데이터의 관리를 위한 다중 해상도 모델

주용진, 박수홍

[Kisti 연계] 대한공간정보학회 한국지형공간정보학회지 Vol.18 No.4 2010 pp.101-107

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

본 연구의 목적은 벡터 도메인 안에 대규모 도로 선형 사상을 대상으로 실시간 데이터 변경, 관리가 가능한 네트워크의 다중 표현 데이터베이스 모델을 구축하는 것이다. 즉, 최상위 레벨의 네트워크 데이터로부터 이에 대응하는 하위 베이스 네트워크 데이터로 순차적으로 데이터 통합과 자동 매칭을 수행하는 상의하달 방식(top-down)을 기초로 하는 프레임워크를 제시하며, 이를 통해 변화 가능한 축척(variable-scale)의 지도를 생성하는 모델을 제안하였다. 구현된 MRDB(Multi-Resolution Database) 모델을 차량 항법 서비스에 적용하여 실제 동적 경로 안내 시스템에 활용 가능함을 확인할 수 있었다.

The aim of this paper is to come up with a methodology of constructing an efficient model for multiple representations which can manage and reconcile real-time data about large-scale roads in Vector Domain. In other words, we suggested framework based on a bottom-up approach, which is allowed to integrate data from the network of the lowest level sequentially and perform automated matching in order to produce variable-scale map. Finally, we applied designed multi-LoD model to in-vehicle application.

 
페이지 저장