29. RNN: 순서를 기억하는 신경망, 순환 구조부터 장기 의존성 문제까지
·
DataScience/DeepLearning
0. 들어가며지난 글에서는 이미지를 다루는 CNN을 살펴봤습니다. CNN은 "가까운 픽셀끼리 관련이 있다"는 공간적 가정을 구조에 담아 이미지에서 큰 성공을 거뒀습니다. 그런데 우리가 다루는 데이터에는 공간이 아니라 순서가 핵심인 것들이 있습니다. 문장, 음성, 로그 스트림, 주가 시계열이 그렇습니다. 지난 글 마지막에 예로 들었던 "나는 밥을 먹었다"와 "밥을 나는 먹었다"처럼, 구성 요소가 같아도 순서가 달라지면 의미가 달라집니다. 데이터 엔지니어링 관점에서 보면 이벤트 로그의 순서가 뒤바뀌면 사용자 행동의 해석이 완전히 달라지는 것과 같습니다.이번 글에서 다룰 RNN(Recurrent Neural Network, 순환 신경망)은 바로 이 "순서"를 다루기 위해 설계된 구조입니다. 순서는 다음과 같이..
28. CNN: 이미지를 '보는' 신경망
·
DataScience/DeepLearning
0. 들어가며딥러닝 시리즈의 첫 번째 주제로 CNN(Convolutional Neural Network, 합성곱 신경망)을 다뤄보겠습니다.요즘에는 챗GPT, 제미나이, 클로드와 같은 거대언어모델(LLM, Large Language Model)이 딥러닝의 중심에 있지만, 이미지 인식 분야에서 "딥러닝이 진짜 된다"는 사실을 세상에 증명한 것은 CNN이었습니다. 2012년 AlexNet이 이미지 인식 대회(ILSVRC)에서 기존 방식들을 큰 격차로 따돌린 사건이 오늘날 딥러닝 붐의 출발점으로 꼽힙니다. 또한 이 시리즈 후반부에서 다룰 Vision Transformer(ViT), Diffusion 모델의 U-Net도 결국 CNN이 정립한 개념들 위에서 발전했습니다.이번 글에서는 다음 순서로 CNN을 정리해보겠..
Airflow 없이도 될까? AWS Glue 6.0 Spark Declarative Pipelines 완전 정리
·
DataEngineering
0. 들어가면서지난 9월 9일, AWS Big Data Blog에 Glue 6.0에서 Spark Declarative Pipelines(SDP) 를 쓰는 방법이 올라왔습니다. 처음 제목만 봤을 때는 "또 하나의 편의 기능인가" 싶었는데, 읽다 보니 생각이 좀 달라지더라고요. 제가 요즘 온프렘 HDFS/Hive 환경을 AWS로 옮기는 작업을 하고 있는데, 그 과정에서 계속 마음에 걸리던 지점이 하나 있었습니다. 비즈니스 로직보다 배선 코드가 길어지는 순간이요. 이 기능이 정확히 그 지점을 겨냥하고 있었습니다.다만 이 기능을 두고 "이제 Airflow 필요 없는 거 아니냐"는 이야기가 나오기 쉬운데, 결론부터 말씀드리면 그건 아닙니다. 대체가 아니라 경계 이동에 가깝습니다. 그 경계가 정확히 어디인지까지 같..
6. 에이전틱 AI 시장 규모와 전망: 데이터로 보는 투자 흐름
·
DE2MLOps
0. 들어가며DE to MLOps 시리즈 6일차입니다. 지난 며칠간 에이전틱 코딩(2일차), AI-Native 개발(4일차), 다중 에이전트(5일차)까지 기술의 "어떻게"를 파고들었습니다. 오늘은 잠시 시선을 넓혀, 시장의 "얼마나"를 데이터로 들여다보겠습니다. 숫자를 보는 이유는 분명합니다. 커리어와 학습의 방향을 정할 때, 시장이 실제로 돈을 어디에 쓰고 있는지는 가장 냉정한 나침반이기 때문입니다. 다만 시장 통계는 인용을 잘못하면 오히려 오해를 부르기 쉬운데, 에이전틱 AI가 특히 그렇습니다. 왜 그런지부터 짚어보겠습니다. 1. 같은 "에이전틱 AI"인데 왜 숫자가 25배 차이날까 도식화에이전틱 AI 시장 자료를 찾다 보면 혼란스러운 상황을 만납니다. 어떤 자료는 "약 90억 달러"라고 하고, 어떤..
5. Multi-Agent System 기초: 여러 에이전트를 협업시키는 아키텍처
·
DE2MLOps
0. 들어가며DE to MLOps 시리즈 5일차입니다. 어제 4일차에서는 AI-Native Development를 다루면서 "여러 에이전트를 협업시킨다"는 표현을 잠깐 스쳐 지나갔습니다. 오늘은 그 부분을 본격적으로 파보겠습니다. 바로 다중 에이전트 시스템(Multi-Agent System, 이하 MAS)입니다.사실 2일차에서 소개한 Claude Code 같은 CLI 에이전트도 내부적으로는 사용자 요청을 여러 하위 작업으로 쪼개어 워커 에이전트에게 위임하는 구조를 쓰고 있습니다. 즉 우리가 이미 쓰고 있는 도구의 속을 들여다보는 셈이기도 합니다. 오늘은 이 MAS가 왜 부상했는지, 어떤 기본 패턴들이 있는지, 그리고 실무에서 무엇을 조심해야 하는지를 정리해보겠습니다. 1. 왜 단일 에이전트를 넘어서게 되..
파티션을 나눠도 못 막는 Iceberg MERGE 충돌: "Runtime file filtering is not possible"의 정체
·
DataEngineering
0. 들어가면서몇 주 전 Iceberg 테이블에 MERGE를 하다 동시 쓰기 충돌을 만났습니다. "Found conflicting files that can contain records matching true". 검색하면 자료가 나오는 에러였고, 파티션 스펙에 구분 컬럼을 추가하고 MERGE 조건에 상수 술어를 넣어 충돌 감지 범위를 좁혔습니다. 조치는 유효했고, 3주 동안 같은 에러가 한 번도 나오지 않았습니다. 그러다가 아래의 에러 메세지를 마주하게 됩니다.Runtime file filtering is not possible: the table has been concurrently modified.Row-level operation scan snapshot ID: 431882613635636801..
4. AI-Native Development란 무엇인가: "코드를 짜는 일"에서 "의도를 정의하는 일"로
·
DE2MLOps
0. 들어가며DE to MLOps 시리즈 4일차입니다. 어제 3일차 실습에서는 CLI 에이전트에게 "무엇을 만들지"만 지시하고 "어떻게 만들지"는 비운 채 파이프라인을 맡겨보았습니다. 그리고 그게 놀랍도록 잘 굴러갔습니다.오늘은 그 경험의 정체를 짚어보려 합니다. 바로 AI-Native Development(AI 네이티브 개발), 더 정확히는 그 핵심 메커니즘인 의도 기반 개발(Intent-Driven Development)입니다. 2026년 소프트웨어 엔지니어링의 판을 바꾸고 있는 이 패러다임이 무엇인지, 그리고 왜 데이터 엔지니어에게도 중요한지 정리해보겠습니다. 1. AI-Native란 "AI를 붙인 것"이 아니다가장 먼저 오해부터 걷어내야 합니다. 많은 분들이 "AI-Native = 제품에 AI 기..
3. CLI 에이전트로 PySpark 파이프라인 짜보기
·
DE2MLOps
0. 들어가며DE to MLOps 시리즈 3일차입니다. 오늘은 지난 2일차에서 에이전틱 코딩의 이론(제안에서 위임으로, plan-build-test-ship 루프)을 다뤘던 것을 예제로 만들어보았고, 이를 실습해보는 내용으로 채울 예정입니다. 실습에 앞서 먼저 환경 구성을 해봐야 할 텐데, 예제의 실행환경 및 사용 프로그램들은 다음과 같습니다.[실습환경]- Apple Silicon Mac(M2 Max)- Claude Code- Docker Desktop이번 예제는 도커를 이용해 Spark 클러스터를 구성하고, 로그 집계 데이터 파이프라인을 생성하는 것이 목표입니다. 단, 모든 환경 세팅부터 코드·테스트까지 전부 CLI 에이전트에게 위임하는 것이 포인트입니다. 미리 공부해서 준비하지 않고, 막히면 어떤 부..
SLYK1D
SLYK1D.log