이전 포스팅에서 우리는 순차적인 데이터를 처리하는 데 특화된 신경망인 RNN에 대해 자세히 알아보았습니다. RNN은 시계열 데이터나 자연어 처리에서 훌륭한 성능을 보여주지만, 입력 시퀀스와 출력 시퀀스의 길이가 다를 때 적용하기 까다롭다는 구조적인 한계를 가지고 있습니다.영어 문장 "I read a book"은 네 단어이지만, 우리말로 옮기면 "나는 책을 읽었다"로 세 어절입니다. 입력 토큰 하나마다 출력 토큰 하나를 내놓는 구조로는 이 대응을 만들 수 없습니다. 길이만 문제인 것도 아닙니다. 영어의 동사 read는 두 번째 자리에 오지만 우리말의 '읽었다'는 문장 맨 끝에 옵니다. 어느 입력이 어느 출력에 대응하는지가 미리 정해져 있지 않고, 그 대응을 알아내는 일 자체가 번역의 일부입니다.2014년에..