32. Attention: 압축하지 않고, 필요할 때 다시 보는 방식

·
DataScience/DeepLearning
0. 들어가며지난 편에서 오토인코더를 다루면서 "전체를 고정 크기 벡터 하나로 압축한다"는 발상을 봤습니다. 거기서는 그게 장점이었습니다. 좁은 통로로 밀어 넣어야 중요한 것만 남으니까요.그런데 같은 발상이 29편 RNN에서는 정반대로 지적됐습니다. 기계 번역 이야기를 하면서, 문장이 아무리 길어도 벡터 하나에 다 밀어 넣어야 한다는 점을 병목으로 짚었습니다.이번에 다룰 어텐션(Attention)은 그 지점을 정면으로 건드립니다. 발상 자체는 한 문장으로 줄어듭니다. "압축해서 들고 다니지 말고, 필요할 때마다 원본을 다시 보자." 말로만 들으면 단순해 보이는데, 이후 딥러닝의 흐름은 대부분 여기서 갈라져 나왔습니다. 지금의 LLM도, 이미지 생성 모델도 결국 이 아이디어 위에 서 있습니다. 이 시리즈에..