Earticle

현재 위치 Home 검색결과

결과 내 검색

발행연도

-

학문분야

자료유형

간행물

검색결과

검색조건
검색결과 : 56
No
1

영역기반 스테레오 영상 정합을 위한 고속 SAD 알고리즘 KCI 등재후보

이우영, 김정길

한국위성정보통신학회 한국위성정보통신학회논문지 제7권 제2호 2012.09 pp.8-12

※ 기관로그인 시 무료 이용이 가능합니다.

4,000원

스테레오 비전 분야에서 영역 기반의 영상 정합은 스테레오 영상 분석을 위한 대표적인 방법이다. SAD (Sum of Absolute Difference) 알고리즘은 영역 기반 정합 알고리즘의 한 종류로서 대규모 데이터 집약적 계산을 요 구하여 소프트웨어 방식을 사용할경우 처리속도가 매우 느리게 된다. 본 논문에서는 소프트웨어 기반 SIMD (Single Instruction Multiple Data) 병렬 기법인 SSE (Streaming SIMD Extensions) 명령어를 이용한 고속 SAD 알고리즘을 제안한다. SSE 명령어를 지원하는 CPU는 16개의 128비트크기의 XMM 레지스터를 보유하여 SIMD 명령어 집합 확장을 가능하게 하였다. 제안하는 소프트웨어 기반 병렬 고속화 기법의성능 측정을 위하여 일반 적 SAD를 이용한 영상 정합 알고리즘과 SSE 명령어를 사용한 알고리즘의 수행 속도차이를 측정하였다. 제안하는 기법은 일반적 SAD 알고리즘보다 평균 4배의 성능 향상의 결과를 보임으로 소프트웨어 기반 고속병 렬 처리를 통한 실시간 스테레오 비전 응용분야에 효과적으로 적용될 수 있음을 보였다.

Area-based stereo matchng algorithms are widely used for image analysis for stereo vision. SAD (Sum of Absolute Difference) algorithm is one of well known area-based stereo matchng algorithms with the characteristics of data intensive computing application. Therefore, it requires very high computation capabilities and its processing speed becomes very slow with software realization. This paper proposes a fast SAD algorithm utilizing SSE (Streaming SIMD Extensions) instructions based on SIMD (Single Instruction Multiple Data) parallism. CPU supporing SSE instructions has 16 XMM registers with 128 bits. For the performance evaluation of the proposed scheme, we compare the processing speed between SAD with/without SSE instructions. The proposed scheme achieves four times performance improvement over the general SAD, which shows the possibility of the software realization of real time SAD algorithm.

2

처리기에 지역 버퍼 메모리 시스템을 지원하는 다중접근기억장치

이형

[Kisti 연계] 한국콘텐츠학회 한국콘텐츠학회논문지 Vol.12 No.1 2012 pp.30-37

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

선형 비틀림 구조를 갖는 메모리 시스템은 SIMD 구조에 적합한 메모리 시스템으로써, 2차원 데이터 배열인 $M{\times}N$에서 임의의 위치로부터 임의의 간격을 갖고 다양한 접근형태들로, m개의 메모리 모듈들에서 n개의 데이터를 동시에 접근할 수 있다. 그러나 이러한 메모리 시스템은 논리적인 2차원 $M{\times}N$ 데이터 배열을 지원하기 위해 $m{\times}cells$의 물리적인 메모리 용량이 필요하지만, 적어도 (m-n)${\times}cells$만큼의 메모리 셀은 사용되지 않는다. 여기서 cells는 (M-1)/q+(N-1)/$p{\times}{\lceil}M/q{\rceil}+1$이다. 본 논문에서는 이러한 메모리 시스템의 모든 기능들을 수용하면서 t>0인 조건 하에 사용되지 않는 메모리 셀들 중 $(n{\times}t){\times}N/p$ 만큼을 n개의 처리기들에 지역 버퍼 메모리로 제공할 수 있는 방법을 제안한다.

A memory system with the linear skewing scheme has been regarded as one of suitable memory systems for a single instruction, multiple data (SIMD) architecture. The memory system supports simultaneous access n data to m memory modules within various access types with a constant interval in an arbitrary position in two dimensional data array of $M{\times}N$. Although $m{\times}cells$ memory cells are physically required to support logical two dimensional $M{\times}N$ array of data by means of the memory system, at least (m-n)${\times}cells$ memory cells remain in disuse, where cells is (M-1)/q+(N-1)/$p{\times}{\lceil}M/q{\rceil}+1$. On keeping functionalities the memory system supports, $(n{\times}t){\times}N/p$ out of a number of unused memory cells, where t>0, being used as local buffer memories for n processing elements is proposed in this paper.

3

SIMD 컴퓨터상에서 효율적인 병렬처리 논리 시뮬레이션

정연모

[Kisti 연계] 한국정보처리학회 정보처리학회논문지 Vol.3 No.2 1996 pp.315-326

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

VLSI 회로의 복잡도 및 집적도가 증가함에 따라서 이들의 검증에 사용되는 논리 시뮬레이션을 위해서 시간이 많이걸린다. 본 논문에서는 SIMD 병렬처리 컴퓨터 상에서 빠른 논리 시뮬레이션 구현을 위한 병렬처리 기법, 자료구조, 알고리즘을 제시한다. 대표적인 병렬처리 컴퓨터인 CM-2상에서 수행한 결과를 제시하고 이를 분석하고자 한다.

As the complexity of VLSI circuits has increased, a lot of simulation time for verifying their correctness has been required. This paper presents efficient parallelel logic simulation protocols, data structures, algorithms to implement fast logic simulation on SIMD parallel processing computers. The performance results of the presented schemes on CM-2 are given and analyzed.

4

4,000원

5

4,000원

6

양자 컴퓨팅 발전에 따른 Shor 알고리즘 및 Grover 알고리즘의 등장으로 인해 기존 공개키암호 알고리즘이 위협받 고 있다. 이에 따라 미국 국립표준기술연구소에서는 양자내성암호 표준화 공모전을 통하여, 양자 컴퓨팅 발전으로 인한 보안 위협에 대비하고 있다. 표준화 공모전을 통해 선정된 4종의 표준화 대상 양자내성암호들은 보안성 및 민 첩성 측면에서 각기 다양한 방식으로 연구되고 있으며, 이 중 격자 기반의 전자서명 알고리즘인 CRYSTALSDilithium은 다항식 곱셈을 위하여 NTT 연산을 이용하고 있으나, 최근 희소 다항식 곱셈을 적용하여 알고리즘 성 능을 향상시킬 수 있다는 연구 결과가 발표된 바 있다. 해당 논문에서는 Cortex-M4, Apple M2 기반 실험 환경을 구축하여 검증을 진행했으나, 다른 ARM 계열 CPU 환경에서도 속도를 향상시킬 수 있는지에 대한 성능 검증은 이 루어지지 않았다. 이에, 본 논문에서는 다른 ARM 계열 CPU 환경에서도 희소 다항식 곱셈을 적용할 경우에 대한 CRYSTALS-Dilithium의 성능을 검증하고자 Dilithium2, Dilithium3, Dilithium5 알고리즘 각각에 대해 세 가지 코드(레퍼런스 코드, 희소 다항식 곱셈 알고리즘, SIMD를 적용한 희소 다항식 곱셈 알고리즘)를 구현하고 이 에 대한 성능을 검증하였다.

The emergence of Shor and Grover algorithms following the development of quantum computing is threatening existing public key encryption algorithms. As a result, the National Institute of Standards and Technology (NIST) is preparing for security threats caused by the development of quantum computing through a competition for standardization of post quantum cryptography. The four types of standardized post quantum cryptography. selected through the standardization contest are being studied in various ways in terms of security and agility, and CRYSTALS-Dilithium, a grid- based digital signature algorithm, uses NTT operation for polynomial multiplication, but recently a research result has been published that shows that algorithm performance can be improved by applying sparse polynomial multiplication [8]. In this paper, Cortex-M4 and Apple M2 based experimental environments were built and verified, but performance verification has not been made on whether speed can be improved in other ARM-based CPU environments. Therefore, in this paper, three codes (reference code, sparse polynomial multiplication algorithm, and sparse polynomial multiplication algorithm with SIMD) were implemented and their performance was verified for each of the Dilithium2, Dilithium3, and Dilithium5 algorithms to verify the performance of CRYSTALSDilithium when applying sparse polynomial multiplication in other ARM-based CPU environments.

7

2차원 그래픽을 3차원 그래픽으로 변환하기 위한 삼차원 그래픽 알고리즘들은 복잡하고 다양한 기법의 사용으로 인하여 대규모의 반복 연산이 요구되고, 이로 인하여 실시간 삼차원 그래픽의 처리가 어려운 경우가 많다. 본 논문은 삼차원 그래픽 처리와 관련된 여러 가지 알고리즘 중에서 Phong Shading 알고리즘의 병렬처리 방법과 고속 하드웨어 처리를 위한 삼차원 그래픽 가속기에 관한 것으로, Park's 다중접근 기억장치와 다수의 연산기로 구성된 SIMD처리기를 사용한 삼차원 그래픽 가속기 구조를 제안하고 있으며, 제안된 가속기 구조를 HDL을 사용한 시뮬레이션을 통해 본 논문에서 제안된 삼차원 그래픽 가속기에 의해 복잡한 알고리즘을 갖은 어떠한 삼차원 그래픽 알고리즘도 병렬 처리 알고리즘을 적용하여 SIMD 가속기에 의한 실시간 처리가 가능함을 보였다.

There are many algorithms for 2D to 3D graphic conversion technology which have the high complexity and large scale of iterative computation. So in this paper propose parallel algorithm and high speed graphics accelerator architecture using Park's MAMS(Multiple Access Memory System) for Phong Shading, one of many 3D algorithms. The Proposed SIMD processor architecture is simulated by HDL and simulated and got 30 times faster result. It means any kinds of 3D algorithm can make parallel algorithm and accelerated by SIMD processor with Park's MAMS for real time processing.

8

고화질 영상에서 고속 안개 제거를 위한 SIMD 구조에 적합한 병렬메모리

이형

[Kisti 연계] 한국컴퓨터정보학회 Journal of the Korea society of computer and information Vol.19 No.7 2014 pp.9-16

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

Dark channel prior를 이용한 안개제거 알고리즘으로 만족할만한 연구결과가 발표된 이후로 이 알고리즘의 처리 속도를 높이기 위한 많은 연구들이 진행되었다. 이들 중에서 median dark channel prior를 이용한 알고리즘이 주목을 받고 있지만 여전히 낮은 처리속도의 한계를 갖고 있다. 그래서 본 논문에서는 고화질 영상에서 고속 안개 제거를 위한 SIMD 구조에 적합한 병렬메모리 모델을 제안한다. 제안하는 병렬메모리 모델은 n개의 화소들에 동시에 접근할 수 있으며, 3, 5, 7 또는 11의 크기를 갖는 4가지 종류의 median filter를 위한 간격들을 허용한다. 그래서 충분한 데이터 대역폭을 지원하기에 median dark channel prior를 이용한 알고리즘을 고속으로 처리할 수 있다.

Since the haze removal algorithm using dark channel prior was introduced, many researches for improving processing speed have been addressed even if it presented impressive results. Remarkable one is using median dark channel prior. Although it has been considered as a very attactive method, processing speed is as low as ever. So, a parallel memory model which is suitable for SIMD architecture processing haze removal on high-definition images in high-speed is introduced in this paper. The proposed parallel memory model allows to access n pixels simultaneously. It is also support stride 3, 5, 7, and 11 in order to execute convolution mask operations, e.g., median filter. The proposed parallel memory model can therefore support enough data bandwidth to process the algorithm using median dark channel prior in high-speed.

9

다중 접근 메모리 시스템을 이용한 고속 지문인식 특징추출 시스템

박종선, 김재희, 고경식, 박종원

[Kisti 연계] 한국멀티미디어학회 멀티미디어학회논문지 Vol.16 No.8 2013 pp.914-926

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

최근 보안 시스템 중에서 지문인식을 이용한 보안 시스템은 다른 보안 시스템에 비해 유일성과 편의성 등의 장점을 가짐으로써 많은 사람들이 관심을 갖는 분야이다. 지문인식 시스템에 있어서 가장 중요한 사항은 실제 지문과 영상을 통해 얻어진 지문간의 정합에서의 정확성과 지문 인식을 위해 사용하는 영상처리 알고리즘들을 신속하게 처리하는 데 있다. 기존의 지문인식 시스템은 특징 추출을 위해 사용하는 알고리즘들의 처리 시간을 줄이기 위해 전체 처리과정 중 일부 과정들을 생략함으로써 처리시간을 단축한다. 하지만 이 방식은 처리시간을 단축시킬 수 있는 반면 특징 추출에 대한 정확도가 떨어진다. 따라서 본 논문에서는 특징 추출에 대한 정확도를 높이기 위해 전체 처리 과정을 사용하면서 동시에 처리시간도 단축시킬 수 있는 다중 접근 메모리 시스템을 이용한 지문인식 특징 추출 알고리즘을 구현하였고, 구현된 시스템을 사용하였을때 다중접근 메모리 시스템과 시리얼 프로세서의 결과에 대해 correlation을 이용한 검증을 통해 제안된 방법의 신뢰도를 확인하였으며, 시리얼 프로세서에 비해 MAMS-PP64를 이용한 방법은 수행시간에서 약 1.56배 향상되었음을 확인하였다.

Among the recent security systems, security system with fingerprint recognition gets many people's interests through the strengths such as exclusiveness, convenience, etc, in comparison with other security systems. The most important matters for fingerprint recognition system are reliability of matching between the fingerprint in database and user's fingerprint and rapid process of image processing algorithms used for fingerprint recognition. The existing fingerprint recognition system reduces the processing time by removing some processes in the feature extraction algorithms but has weakness of a reliability. This paper realizes the fingerprint recognition algorithm using MAMS(Multi-Access Memory System) for both the rapid processing time and the reliability in feature extraction and matching accuracy. Reliability of this process is verified by the correlation between serial processor's results and MAMS-PP64's results. The performance of the method using MAMS-PP64 is 1.56 times faster than compared serial processor.

10

SIMD 최적화를 이용한 CPU 기반 그래프 엔진의 성능 개선

조익현, 장명환, 김상욱

[Kisti 연계] 한국정보처리학회 한국정보처리학회 학술대회논문집 2023 pp.383-385

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

Single-machine-based 그래프 엔진의 state-of-the-art 모델인 RealGraph 는 쓰레드를 이용한 병렬화로 성능을 향상하였으나 쓰레드 내부에서의 병렬성은 고려되지 않았다. 본 논문은 SIMD 명령어를 이용해 RealGraph 의 병렬성을 향상시켰다. 쓰레드 내부의 효율성을 높이기 위해 RealGraph 의 구조와 그래프 알고리즘의 분석을 통한 SIMD 명령어의 적용 가능한 영역을 탐색하였다. 실험으로 SIMD 명령어의 적용을 통해 쓰레드 내부에서 벡터 연산을 수행하여 평균 7.6%, 11.7%, 9.2%의 수행 시간 단축을 이끌어냈으며 SIMD 명령어의 적용이 그래프 엔진의 분석 성능에 얼마나 도움이 될 수 있는지 확인하였다.

11

SIMD 명령어를 활용한 정렬된 데이터에 대한 효율적인 그룹 연산 처리

이훈순, 김창수

[Kisti 연계] 한국정보과학회 정보과학회 컴퓨팅의 실제 논문지 Vol.24 No.7 2018 pp.375-380

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

근래의 대부분의 컴퓨터에서는 컴퓨팅 기술의 발달로 벡터 처리 유닛이 포함됨으로 인해 과거에 벡터 프로세서로 구성된 일부 슈퍼 컴퓨터들만이 지원했던 벡터 처리 기능을 지원하고 있다. 데이터 분석 응용에서는 데이터를 특정 기준으로 그룹핑하는 요구가 많으며 이는 많은 시간을 필요로 한다. 본 논문에서는 SIMD 명령어를 활용하여 정렬된 데이터에 대한 그룹 연산을 벡터 처리 기반으로 효율적으로 처리하는 방법을 제안한다. 제안하는 방법을 열기반 DBMS인 MonetDB의 그룹 연산에 적용한 후 실험을 통해 그룹 연산의 성능이 스칼라 기반 방법에 비해 향상되었음을 확인하였다.

With advances in computing technology, most computers now support vector processing that was previously only supported by certain supercomputers which were made up of vector processors. In data analytics applications, there is a high demand for the ability to group data by specific criteria, which requires a lot of time. In this paper, we propose a method for the efficient processing of group operations on sorted data through vector processing using SIMD instructions. We applied the proposed method to the group operation of MonetDB which is a column-oriented DBMS and confirmed that the performance of the group operation in MonetDB was improved through the experiment using the TPC-H query.

12

SIMD 기반의 VBP 기법을 적용한 효율적인 퀵정렬의 구현

홍길석, 김홍연, 강성현, 민준기

[Kisti 연계] 한국정보과학회 정보과학회 컴퓨팅의 실제 논문지 Vol.23 No.8 2017 pp.498-503

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

SIMD(Single Instruction Multiple Data)는 대표적인 병렬화 아키텍처 중 하나로, SIMD 레지스터에 적재된 여러 개의 데이터들을 하나의 명령어로 처리하는 기술이다. 퀵정렬(Quicksort)은 데이터 값들이 리스트로 저장되어 있을 때, 임의의 위치에 있는 데이터 값을 피봇으로 하여 그것보다 작은 값은 왼편으로, 큰 값은 오른편으로 분할하여 생성된 두 개의 서브리스트에 대하여 같은 작업을 반복함으로써 데이터 값들을 정렬하는 정렬 알고리즘이다. 본 연구에서는 SIMD 명령어를 이용하여 파이프라인 아키텍처에서 조건 예측 실패에 따른 성능 저하를 유발하지 않도록 분기 조건을 최소로 사용하는 효율적인 퀵정렬(Quicksort) 알고리즘을 제안한다. 또한, VBP(Vertical Bit Parallel) 기법과 얼리 프루닝(early pruning) 기법을 적용하여 SIMD 레지스터에 데이터를 바이트 단위로 적재함으로써 퀵 정렬 알고리즘의 성능을 향상하였다.

SIMD (Single Instruction Multiple Data) is a representative parallelization architecture that processes multiple data loaded in a SIMD register with a single instruction. Quicksort is a sorting algorithm that picks an element as a pivot from the array and reorders the array such that all elements having the values less than the pivot value are located in the left side on the pivot as well as all elements having the value greater than the pivot value are located in the right side on the pivot and then the algorithm performs the same task on both sublist recursively. In this paper, we propose an efficient Quicksort algorithm applying the SIMD instructions which minimally invokes conditional branches to avoid the performance degradation incurred by branch misprediction in a pipeline architecture. In addition, we improve the performance of the Quicksort algorithm by fetching data into a SIMD register as a byte unit to apply VBP (Vertical Bit Parallel) and the early pruning technique.

13

SIMD 명령어 기반 HEVC RExt 복호화기 고속화

목정수, 안용조, 류호찬, 심동규

[Kisti 연계] 한국방송공학회 방송공학회논문지 Vol.20 No.2 2015 pp.224-237

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

본 논문은 HEVC RExt (High Efficiency Video Coding Range Extension)을 위한 SIMD (Single Instruction Multiple Data) 명령어 기반의 고속 복호화 방법을 소개한다. RExt의 화면 내 예측, 보간필터, 역-양자화, 역-변환, 클리핑 모듈들은 반복적인 산술 연산 혹은 논리 연산을 수행하는 구조로써 SIMD 명령어 집합을 적용하기 적합한 모듈로 분류할 수 있다. 본 논문은 RExt의 증가한 비트 심도를 고려하여 화면 내 예측, 보간필터, 역-양자화, 역-변환, 클리핑 모듈을 SSE (Streaming SIMD Extension) 명령어 집합을 이용하여 연산하는 방법을 소개한다. 또한, 256비트 레지스터를 사용할 수 있는 AVX2 (Advanced Vector eXtension 2) 명령어 집합을 이용하여 보간필터, 역-양자화, 클리핑 모듈의 연산을 효율적으로 연산하는 방법을 제안한다. 본 논문에서 제안하는 SIMD 명령어 기반의 고속 복호화 방법은 HEVC 참조 소프트웨어 HM 16.0을 기반으로 자체 개발한 HEVC RExt 복호화기에서 기존의 순차적 연산 방식 대비 평균 12%의 속도향상을 얻을 수 있었다.

In this paper, we introduce the fast decoding method with the SIMD (Single Instruction Multiple Data) instructions for HEVC RExt (High Efficiency Video Coding Range Extensions). Several tools of HEVC RExt such as intra prediction, interpolation, inverse-quantization, inverse-transform, and clipping modules can be classified as the proper modules for applying the SIMD instructions. In consideration of bit-depth increasement of RExt, intra prediction, interpolation, inverse-quantization, inverse-transform, and clipping modules are accelerated by SSE (Streaming SIMD Extension) instructions. In addition, we propose effective implementations for interpolation filter, inverse-quantization, and clipping modules by utilizing a set of AVX2 (Advanced Vector eXtension 2) instructions that can use 256 bits register. The evaluation of the proposed methods were performed on the private HEVC RExt decoder developed based on HM 16.0. The experimental results show that the developed RExt decoder reduces 12% average decoding time, compared with the conventional sequential method.

14

SIMD 구조를 갖는 프로세서에서 FFT 연산 가속화

이주영, 홍용근, 이현석

[Kisti 연계] 대한전자공학회 Journal of the Institute of Electronics Engineers of Korea Vol.52 No.2 2015 pp.97-105

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

이 논문은 SIMD 구조를 갖는 프로세서에서 FFT 연산을 효과적으로 처리하는 방법에 대한 것이다. FFT는 디지털 신호처리 분야에서 널리 사용되는 범용 알고리즘으로 이의 효과적인 처리는 성능 향상에 있어서 매우 중요하다. Bruun 알고리즘은 반복적인 인수분해를 통해 구현되는 FFT 알고리즘으로, 널리 사용되는 Cooley-Tukey 알고리즘에 비해 복소수 곱셈이 아닌 실수 곱셈으로 대부분의 동작을 수행하는 장점을 가지고 있으나, SIMD 프로세서에서 구현하는 데는 벡터 데이터의 정렬 형태가 복잡하고 연산에 필요한 계수들을 저장할 메모리를 더 필요로 하는 단점이 있다. 실험 결과에 따르면 길이 1024인 FFT 연산을 SIMD 프로세서에서 수행하는데 있어서 Bruun 알고리즘은 Cooley-Tukey 알고리즘에 비해서 약 1.2배의 더 높은 처리성능을 보이지만, 약 4 배 더 큰 데이터 메모리를 필요로 한다. 따라서 데이터 메모리에 대한 제약이 큰 경우가 아니라면 SIMD 프로세서에서 Bruun 알고리즘이 FFT 연산에 적합하다.

This paper discusses the implementation of Bruun's FFT on a SIMD processor. FFT is an algorithm used in digital signal processing area and its effective processing is important in the enhancement of signal processing performance. Bruun's FFT algorithm is one of fast Fourier transform algorithms based on recursive factorization. Compared to popular Cooley-Tukey algorithm, it is advantageous in computations because most of its operations are based on real number multiplications instead of complex ones. However it shows more complicated data alignment patterns and requires a larger memory for storing coefficient data in its implementation on a SIMD processor. According to our experiment result, in the processing of the FFT with 1024 complex input data on a SIMD processor, The Bruun's algorithm shows approximately 1.2 times higher throughput but uses approximately 4 times more memory (20 Kbyte) than the Cooley-Tukey algorithm. Therefore, in the case with loose constraints on silicon area, the Bruun's algorithm is proper for the processing of FFT on a SIMD processor.

15

SIMD를 이용한 HEVC 하다마드 트랜스폼의 고속 구현

유종훈, 조현호, 심동규

[Kisti 연계] 한국방송공학회 한국방송공학회 학술대회논문집 2011 pp.307-309

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

본 논문에서는 SIMD(Single Instruction Multiple Data) 프로세서를 사용한 HEVC 부호화기의 하다마트 트랜스폼 고속화를 제안한다. 본 논문에서는 MMX와 SSE 레지스터를 사용하여 하다마드 트랜스폼을 SIMD 연산으로 대체함으로써 메모리 접근 횟수와 명령어의 수를 줄여 부호화기를 고속화하였다. 또한, HEVC의 10비트 입력에 따른 SIMD 구조의 비효율적인 구현을 해결하기 위하여 하다마드 트랜스폼의 입력 픽셀 비트수를 감소시키는 IBDD(Internal Bit Depth Decreasing)를 제안했다. HEVC 부호화기에 하다마드 트랜스폼을 SIMD 연산으로 대체한 결과 부호화 효율의 저하 없이, 부호화기의 수행 시간은 10% 감소되었다.

16

SIMD 명령어가 추가된 VLIW ASIP 프로세서

양승준, 박상현, 허인구, 이종원, 김용주, 백윤흥

[Kisti 연계] 한국정보처리학회 한국정보처리학회 학술대회논문집 2010 pp.1589-1590

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

VLIW 아키텍처는 동시에 여러 개의 명령어를 수행하면서도 상대적으로 크기가 작으며 적은 전력을 소모한다는 장점 때문에 임베디드 어플리케이션을 처리하기 위해 많이 쓰이고 있다. 본 논문에서는 SIMD 명령어를 추가한 VLIW 아키텍처를 설계함으로써 동영상 처리와 같은 미디어 어플리케이션을 효과적으로 처리할 수 있도록 하였다.

17

SIMD 명령어가 추가된 VLIW ASIP 프로세서

양승준, 박상현, 허인구, 이종원, 김용주, 백윤흥

[Kisti 연계] 한국정보처리학회 한국정보처리학회 학술대회논문집 2010 pp.1589-1590

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

VLIW 아키텍처는 동시에 여러 개의 명령어를 수행하면서도 상대적으로 크기가 작으며 적은 전력을 소모한다는 장점 때문에 임베디드 어플리케이션을 처리하기 위해 많이 쓰이고 있다. 본 논문에서는 SIMD 명령어를 추가한 VLIW 아키텍처를 설계함으로써 동영상 처리와 같은 미디어 어플리케이션을 효과적으로 처리할 수 있도록 하였다.

18

SIMD 명령어를 이용한 영상의 평균화 필터 최적화

김준철, 최학남, 박은수, 김학일

[Kisti 연계] 대한전기학회 대한전기학회 학술대회논문집 2007 pp.431-432

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

본 연구에서는 영상의 잡음 제거에 우수한 평균화 필터 알고리즘을 SIMD(Single Instruction Multiple Data) 명령어를 이용하여 고속화하였다. 먼저 순차 알고리즘의 속도 향상을 위한 최적화를 수행하고, SIMD에 적합 하도록 변환 하여 4 또는 16 개의 데이터를 동시에 연산이 가능하도록 하였다. 또한 나누기 연산을 줄이기 위하여 8비트의 데이터 타입과 함께 룩업 테이블(Lookup Table)을 이용하였다. 각각의 데이터 타입에 적합하게 알고리즘을 변환하여 비교하였고 실험을 통하여 기존의 순차 처리방식에 비해 평균적으로 2.5배 이상의 속도 향상을 보았다.

19

근사 덧셈을 사용하는 SIMD 포화 덧셈기

윤준기, 오형철

[Kisti 연계] 한국정보과학회 한국정보과학회 학술대회논문집 2004 pp.691-693

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

0.18$\mu\textrm{m}$ 표준 셀 라이브러리로 구현할 때 2.69㎱의 임계 경로 지연을 가지는 SIMD구조의 포화 덧셈기를 설계하였다. 기존의 설계에서 임계 경로를 구성하는 CLA를, 8비트까지만 자리올림(Carry)이 전파될 때 정확한 계산을 보장하는 근사 덧셈기의 형태로 설계한 결과, 임계 경로 시간 지연을 약 22% 감소시킬 수 있었다. 파이프라인 구조 프로세서에서 사용될 포화 덧셈기의 근사계산이 실패하는 경우에는, 추가적인 2개의 클록주기 동안 재 계산을 수행하게 된다.

20

SIMD 기반의 효율적인 4$\times$4 정수변환 방법

유상준, 오승준, 안창범

[Kisti 연계] 한국정보과학회 한국정보과학회 학술대회논문집 2004 pp.55-57

※ 협약을 통해 무료로 제공되는 자료로, 원문이용 방식은 연계기관의 정책을 따르고 있습니다.

원문보기

DCT(Discrete Cosine Transform)는 현존하는 블록기반 영상 압축 코딩기법의 핵심이 되는 부분이다. 많은 고속 방법이 제안되었으며, 최근 들어 SIMD 병렬구조를 이용한 고속방법들이 제안되고 있다. 본 논문에서는 SIMD명령어를 가지는 프로세서에서 4$\times$4 정수변환의 속도를 최적화하기 위한 알고리즘을 제안한다. 본 논문에서 제안하는 알고리즘은 128비트 SIMD영령어로 확장이 가능하며 비슷한 구조를 가지는 Hadamard 변환에서 적용할 수 있다. 제안하는 방법을 펜티엄4 2.4G에서 구현할 경우 H.264 참조 부호화기의 4$\times$4 정수변환 방법보다 64비트 SIMD 명령어를 사용할 경우 4.34배 128-bit SIMD 명령어를 사용할 경우 6.77배의 성능을 얻을 수 있다.

 
1 2 3
페이지 저장