년 - 년
ARM 기반 환경에서 희소 다항식 곱셈과 SIMD를 활용한 CRYSTALS-Dilithium 서명 알고리즘 최적화 및 성능 비교 KCI 등재
한국차세대컴퓨팅학회 한국차세대컴퓨팅학회 논문지 Vol.21 No.1 2025.02 pp.38-48
양자 컴퓨팅 발전에 따른 Shor 알고리즘 및 Grover 알고리즘의 등장으로 인해 기존 공개키암호 알고리즘이 위협받 고 있다. 이에 따라 미국 국립표준기술연구소에서는 양자내성암호 표준화 공모전을 통하여, 양자 컴퓨팅 발전으로 인한 보안 위협에 대비하고 있다. 표준화 공모전을 통해 선정된 4종의 표준화 대상 양자내성암호들은 보안성 및 민 첩성 측면에서 각기 다양한 방식으로 연구되고 있으며, 이 중 격자 기반의 전자서명 알고리즘인 CRYSTALSDilithium은 다항식 곱셈을 위하여 NTT 연산을 이용하고 있으나, 최근 희소 다항식 곱셈을 적용하여 알고리즘 성 능을 향상시킬 수 있다는 연구 결과가 발표된 바 있다. 해당 논문에서는 Cortex-M4, Apple M2 기반 실험 환경을 구축하여 검증을 진행했으나, 다른 ARM 계열 CPU 환경에서도 속도를 향상시킬 수 있는지에 대한 성능 검증은 이 루어지지 않았다. 이에, 본 논문에서는 다른 ARM 계열 CPU 환경에서도 희소 다항식 곱셈을 적용할 경우에 대한 CRYSTALS-Dilithium의 성능을 검증하고자 Dilithium2, Dilithium3, Dilithium5 알고리즘 각각에 대해 세 가지 코드(레퍼런스 코드, 희소 다항식 곱셈 알고리즘, SIMD를 적용한 희소 다항식 곱셈 알고리즘)를 구현하고 이 에 대한 성능을 검증하였다.
The emergence of Shor and Grover algorithms following the development of quantum computing is threatening existing public key encryption algorithms. As a result, the National Institute of Standards and Technology (NIST) is preparing for security threats caused by the development of quantum computing through a competition for standardization of post quantum cryptography. The four types of standardized post quantum cryptography. selected through the standardization contest are being studied in various ways in terms of security and agility, and CRYSTALS-Dilithium, a grid- based digital signature algorithm, uses NTT operation for polynomial multiplication, but recently a research result has been published that shows that algorithm performance can be improved by applying sparse polynomial multiplication [8]. In this paper, Cortex-M4 and Apple M2 based experimental environments were built and verified, but performance verification has not been made on whether speed can be improved in other ARM-based CPU environments. Therefore, in this paper, three codes (reference code, sparse polynomial multiplication algorithm, and sparse polynomial multiplication algorithm with SIMD) were implemented and their performance was verified for each of the Dilithium2, Dilithium3, and Dilithium5 algorithms to verify the performance of CRYSTALSDilithium when applying sparse polynomial multiplication in other ARM-based CPU environments.
Optimization of GEMV on Intel AVX Processor SCOPUS
보안공학연구지원센터(IJDTA) International Journal of Database Theory and Application Vol.9 No.2 2016.02 pp.47-60
※ 원문제공기관과의 협약기간이 종료되어 열람이 제한될 수 있습니다.
To improve the performance of BLAS 2 GEMV subroutine under the latest instruction set, Intel AVX, this paper presents a new approach to analyze the new generation instruction set and enhance the efficiency of current data-oriented math subroutines. The whole optimizing process involves memory access optimization, SIMD optimization and parallel optimization. Also, this paper shows the comparison between the traditional SSE instruction set and the AVX instruction set. Experiments show that the optimized GEMV function has obtained considerable increase on performance. Compared with the Intel MKL, GotoBLAS, ATLAS, this optimized GEMV exceeds these BLAS implementations from 5% to 10%.
SIMD 최적화를 이용한 CPU 기반 그래프 엔진의 성능 개선
[Kisti 연계] 한국정보처리학회 한국정보처리학회 학술대회논문집 2023 pp.383-385
※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.
Single-machine-based 그래프 엔진의 state-of-the-art 모델인 RealGraph 는 쓰레드를 이용한 병렬화로 성능을 향상하였으나 쓰레드 내부에서의 병렬성은 고려되지 않았다. 본 논문은 SIMD 명령어를 이용해 RealGraph 의 병렬성을 향상시켰다. 쓰레드 내부의 효율성을 높이기 위해 RealGraph 의 구조와 그래프 알고리즘의 분석을 통한 SIMD 명령어의 적용 가능한 영역을 탐색하였다. 실험으로 SIMD 명령어의 적용을 통해 쓰레드 내부에서 벡터 연산을 수행하여 평균 7.6%, 11.7%, 9.2%의 수행 시간 단축을 이끌어냈으며 SIMD 명령어의 적용이 그래프 엔진의 분석 성능에 얼마나 도움이 될 수 있는지 확인하였다.
[Kisti 연계] 대한전기학회 대한전기학회 학술대회논문집 2007 pp.431-432
※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.
본 연구에서는 영상의 잡음 제거에 우수한 평균화 필터 알고리즘을 SIMD(Single Instruction Multiple Data) 명령어를 이용하여 고속화하였다. 먼저 순차 알고리즘의 속도 향상을 위한 최적화를 수행하고, SIMD에 적합 하도록 변환 하여 4 또는 16 개의 데이터를 동시에 연산이 가능하도록 하였다. 또한 나누기 연산을 줄이기 위하여 8비트의 데이터 타입과 함께 룩업 테이블(Lookup Table)을 이용하였다. 각각의 데이터 타입에 적합하게 알고리즘을 변환하여 비교하였고 실험을 통하여 기존의 순차 처리방식에 비해 평균적으로 2.5배 이상의 속도 향상을 보았다.
[Kisti 연계] 한국멀티미디어학회 한국멀티미디어학회 학술대회논문집 2003 pp.175-178
※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.
최근에 표준화가 완료된 차세대 비디오 코딩 표준인 H.264 는 적은 비트율에서 높은 품질의 비디오 압축을 목표로 하기 때문에, H.263+ 및 MPEG-2/4 와 같은 이전의 표준들보다 훨씬 더 많은 연산을 필요로 한다. 본 논문은 SIMD (Single Instruction Multiple Data) 명령어를 가지는 범용 프로세서(예를 들면, 펜티엄 4)에서 H.264 S/W 인코더의 속도 최적화를 위한 알고리듬 및 구현 기술을 제안한다. 화질 저하 없이 RDO (Rate Distortion Optimization) 의 속도를 높일 수 있는 효율적인 모드 검색 건너뛰기 알고리듬을 제안하고, SIMD 명령어를 이용하여 1/4 화소 보간, SAD(Sum of Absolute Difference), SATD(Sum of Absolute Transformed Difference), SSD (Sum of Squared Difference) 등의 개별 루틴의 속도를 최적화한다. 일련의 최적화 후에 인코더는 화질 저하 없이 H.264 레퍼런스 인코더보다 평균 3배 정도의 속도 향상이 이루어진다.
Advanced SIMD를 이용한 움직임 추정 최적화 방법
[Kisti 연계] 한국정보처리학회 한국정보처리학회 학술대회논문집 2012 pp.54-56
※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.
최근 CPU의 코어 클럭을 높이는 대신 동일한 클럭의 코어 수를 늘림으로써 성능을 향상시키고 전력 소모도 줄이는 멀티코어가 등장하고 있다. 이러한 멀티코어 플랫폼의 등장으로 인해 해당 코어들의 자원을 효율적으로 사용하여 동시에 처리하는 병렬처리 기법에 관한 연구가 활발히 진행되고 있다. 본 논문에서는 병렬처리 기법의 종류 중 하나인 Advanced SIMD기반의 NEON을 적용한 고속화 ME 방법론을 연구 및 제안하였다. 최소화 SAD를 구하고 정확한 모션벡터를 선정하기 위해 다양한 ME 방법 중 전역탐색기법을 NEON에 적용하여 동시에 128비트씩 연산을 수행하였다. 그 결과 영상의 크기에 따라 계산 성능이 최대 60% 이상 향상되는 효과를 검증하였다.
Advanced SIMD를 이용한 움직임 추정 최적화 방법
[Kisti 연계] 한국정보처리학회 한국정보처리학회 학술대회논문집 2012 pp.54-56
※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.
최근 CPU의 코어 클럭을 높이는 대신 동일한 클럭의 코어 수를 늘림으로써 성능을 향상시키고 전력 소모도 줄이는 멀티코어가 등장하고 있다. 이러한 멀티코어 플랫폼의 등장으로 인해 해당 코어들의 자원을 효율적으로 사용하여 동시에 처리하는 병렬처리 기법에 관한 연구가 활발히 진행되고 있다. 본 논문에서는 병렬처리 기법의 종류 중 하나인 Advanced SIMD기반의 NEON을 적용한 고속화 ME 방법론을 연구 및 제안하였다. 최소화 SAD를 구하고 정확한 모션벡터를 선정하기 위해 다양한 ME 방법 중 전역탐색기법을 NEON에 적용하여 동시에 128비트씩 연산을 수행하였다. 그 결과 영상의 크기에 따라 계산 성능이 최대 60% 이상 향상되는 효과를 검증하였다.
0개의 논문이 장바구니에 담겼습니다.
선택하신 파일을 압축중입니다.
잠시만 기다려 주십시오.