인공신경망 기계번역에서 말뭉치 간의 균형성을 고려한 성능 향상 연구

박찬준; 박기남; 문현석; 어수경; 임희석

216.73.216.202

개인회원 가입

개인회원
기관회원

개인회원 로그인

개인회원 가입으로 더욱 편리하게 이용하세요. 개인회원 가입

아이디/비밀번호를 잊으셨나요? 아이디/비밀번호 찾기

기관회원 로그인

소속기관에서 검색되지 않는 기관은 무료원문다운이 불가능합니다. 개인회원 가입 후 유료구매를 하시거나 소속기관 도서관에 이용문의해 주세요.

Home

인공신경망 기계번역에서 말뭉치 간의 균형성을 고려한 성능 향상 연구
A study on performance improvement considering the balance between corpus in Neural Machine Translation

발행기관

한국융합학회 바로가기
간행물

한국융합학회논문지 KCI 등재 바로가기
통권

제12권 제5호 (2021.05)바로가기
페이지

pp.23-29
저자

박찬준, 박기남, 문현석, 어수경, 임희석
언어

한국어(KOR)
URL

https://www.earticle.net/Article/A394941

※ 기관로그인 시 무료 이용이 가능합니다.

4,000원

원문정보

초록

영어: Recent deep learning-based natural language processing studies are conducting research to improve performance by training large amounts of data from various sources together. However, there is a possibility that the methodology of learning by combining data from various sources into one may prevent performance improvement. In the case of machine translation, data deviation occurs due to differences in translation(liberal, literal), style(colloquial, written, formal, etc.), domains, etc. Combining these corpora into one for learning can adversely affect performance. In this paper, we propose a new Corpus Weight Balance(CWB) method that considers the balance between parallel corpora in machine translation. As a result of the experiment, the model trained with balanced corpus showed better performance than the existing model. In addition, we propose an additional corpus construction process that enables coexistence with the human translation market, which can build high-quality parallel corpus even with a monolingual corpus.

한국어: 최근 딥러닝 기반 자연언어처리 연구들은 다양한 출처의 대용량 데이터들을 함께 학습하여 성능을 올리고자 하는 연구들을 진행하고 있다. 그러나 다양한 출처의 데이터를 하나로 합쳐서 학습시키는 방법론은 성능 향상을 막게 될 가능성이 존재한다. 기계번역의 경우 병렬말뭉치 간의 번역투(의역, 직역), 어체(구어체, 문어체, 격식체 등), 도메인 등의 차이로 인하여 데이터 편차가 발생하게 되는데 이러한 말뭉치들을 하나로 합쳐서 학습을 시키게 되면 성능의 악영 향을 미칠 수 있다. 이에 본 논문은 기계번역에서 병렬말뭉치 간의 균형성을 고려한 Corpus Weight Balance (CWB) 학습 방법론을 제안한다. 실험결과 말뭉치 간의 균형성을 고려한 모델이 그렇지 않은 모델보다 더 좋은 성능을 보였다. 더불어 단일 말뭉치로도 고품질의 병렬 말뭉치를 구축할 수 있는 휴먼번역 시장과의 상생이 가능한 말뭉치 구축 프로세 스를 추가로 제안한다.

키워드

기계번역 병렬말뭉치 휴먼번역 고품질 데이터 딥러닝 언어융합 Machine Translation Parallel Corpus Human Translation High Quality Data Deep Learning Language Conversion

저자

박찬준 [ Chanjun Park | 고려대학교 컴퓨터학과 석·박사통합과정 ]
박기남 [ Kinam Park | 고려대학교 정보창의교육연구소 연구교수 ]
문현석 [ Hyeonseok Moon | 고려대학교 컴퓨터학과 석·박사통합과정 ]
어수경 [ Sugyeong Eo | 고려대학교 컴퓨터학과 석·박사통합과정 ]
임희석 [ Heuiseok Lim | 고려대학교 컴퓨터학과 교수 ] Corresponding Author

참고문헌

자료제공 : 네이버학술정보

간행물 정보

발행기관

발행기관명

한국융합학회 [Korea Convergence Society]
설립연도
2011
분야
복합학>학제간연구
소개
본회는 융합학문 및 융합기술을 교류를 통한 학문기술의 확대․발전․보급 및 기술개발 전략에 과학적으로 접근하여 융합학문 및 기술을 더욱 활성화하고, 회원 상호간의 정보 교류를 도모함으로써 지역과 나라발전에 기여함을 목적으로 한다.

간행물

간행물명

한국융합학회논문지 [Journal of the Korea Convergence Society]
간기
월간
pISSN
2233-4890
수록기간
2010~2022
십진분류
KDC 530 DDC 620

이 권호 내 다른 논문 / 한국융합학회논문지 제12권 제5호

피인용수 : 0건 (자료제공 : 네이버학술정보)

함께 이용한 논문 이 논문을 다운로드한 분들이 이용한 다른 논문입니다.

출처 : 네이버학술정보

0개의 논문이 장바구니에 담겼습니다.

페이지 저장

소속기관 조회

이용자님의 소속기관(단체)이 서비스에 가입되어 있는지 확인해 보십시오.
기관회원에 소속되어 있는 이용자는 원문을 무료로 이용할 수 있습니다.

상호: 주식회사 학술교육원 I 대표: 노방용 I 사업자등록번호: 122-81-88227 I 통신판매업신고번호: 제2008-인천부평-00176호 I 정보보호책임자: 이두영
주소: (21319)인천광역시 부평구 영성중로 50 미래타워 701호 I 전화: 0505-555-0740 I 팩스: 0505-555-0741 I 이메일: earticle@earticle.net

음성지원 및 돋보기 서비스

Earticle

인공신경망 기계번역에서 말뭉치 간의 균형성을 고려한 성능 향상 연구
A study on performance improvement considering the balance between corpus in Neural Machine Translation

원문정보

초록

목차

키워드

저자

참고문헌

간행물 정보

발행기관

간행물

이 권호 내 다른 논문 / 한국융합학회논문지 제12권 제5호

피인용수 : 0건 (자료제공 : 네이버학술정보)

함께 이용한 논문 이 논문을 다운로드한 분들이 이용한 다른 논문입니다.

Earticle

인공신경망 기계번역에서 말뭉치 간의 균형성을 고려한 성능 향상 연구 A study on performance improvement considering the balance between corpus in Neural Machine Translation

원문정보

초록

목차

키워드

저자

참고문헌

간행물 정보

발행기관

간행물

이 권호 내 다른 논문 / 한국융합학회논문지 제12권 제5호

피인용수 : 0건 (자료제공 : 네이버학술정보)

함께 이용한 논문 이 논문을 다운로드한 분들이 이용한 다른 논문입니다.

인공신경망 기계번역에서 말뭉치 간의 균형성을 고려한 성능 향상 연구
A study on performance improvement considering the balance between corpus in Neural Machine Translation