4. SCD - 고객 주소가 바뀌면 과거 주문은 어디로 배송된 걸로 남는가

차원 데이터가 바뀌면 과거를 덮어쓸지 이력을 남길지 선택해야 합니다. SCD Type 1, 2, 3의 차이를 SQL로 직접 구현하고, dbt snapshot으로 프로덕션 패턴을 만듭니다.

2월 22, 2026 · 8 분 · Junho Lee

3. Silver 레이어 - Bronze를 분석 가능한 상태로 올린다

Bronze에 쌓아둔 원본 데이터를 정제하고 표준화합니다. 타입을 맞추고 컬럼명을 통일하며 중복을 제거합니다. dbt로 이 과정을 SQL 모델로 정의합니다.

2월 22, 2026 · 5 분 · Junho Lee

2. Bronze 레이어 - 원본을 있는 그대로 쌓는다

Bronze에 데이터를 넣는 방법은 두 가지입니다. 전체를 덮어쓰거나 바뀐 것만 가져오는 방식입니다. 어떤 방식을 고르느냐에 따라 파이프라인 복잡도가 완전히 달라집니다.

2월 22, 2026 · 5 분 · Junho Lee

1. 메달리온 아키텍처 - 데이터를 세 겹으로 쌓는 이유

Bronze, Silver, Gold. 데이터를 레이어별로 나눠 적재하면 무엇이 달라지는지 DuckDB와 dbt로 직접 구성해 봅니다.

2월 22, 2026 · 4 분 · Junho Lee

5. LLM 시대의 데이터 모델링

코드보다 모델링이 먼저라는 게시글의 참고자료 7개를 읽고 남은 것을 정리한 글입니다. 도구가 세 번 바뀌어도 살아남은 원칙, 실무에서 쓰이는 이력 관리 구현 네 가지, 가장 늦게 드러나는 조직 부채를 다룹니다.

9월 12, 2026 · 8 분 · Junho Lee
LLM이 SQL을 직접 쓰지 않게 만드는 시맨틱 레이어 활용법

LLM이 SQL을 직접 쓰지 않게 만드는 시맨틱 레이어 활용법

DB Schema를 통째로 전달해 SQL을 생성하는 대신 Fact 테이블 위에서 Semantic Layer를 조립하게 만드는 데이터 분석 에이전트 구조를 살펴봅니다.

8월 24, 2026 · 2 분 · Junho Lee
실시간 소셜 데이터와 에이전트 아키텍처의 설계 흐름

실시간 소셜 데이터와 에이전트 아키텍처의 설계 흐름

실시간 소셜 피드 스트리밍과 LLM Agent 오케스트레이션을 결합한 구조적 특징과 파이프라인 제약 사항을 정리합니다.

7월 24, 2026 · 2 분 · Junho Lee
LLM과 SQL을 결합한 시맨틱 데이터프레임 엔진 fenic

LLM과 SQL을 결합한 시맨틱 데이터프레임 엔진 fenic

fenic은 PySpark/SQL 스타일 연산과 LLM 기반 시맨틱 연산자를 통합하여 정형 및 비정형 데이터를 지속 가능한 데이터프레임 파이프라인으로 처리하는 쿼리 엔진입니다.

7월 11, 2026 · 2 분 · Junho Lee
로컬 환경 오픈소스 AI 메모리 시스템, MemPalace

로컬 환경 오픈소스 AI 메모리 시스템, MemPalace

데이터 유출 걱정 없는 로컬 오픈소스 메모리 시스템 MemPalace를 소개합니다. 평면적 벡터 검색의 한계를 넘어선 계층적 데이터 관리 방식을 다룹니다.

6월 28, 2026 · 1 분 · Junho Lee
Databricks AI Search에서 Kiwi를 활용한 한국어 검색 최적화

Databricks AI Search에서 Kiwi를 활용한 한국어 검색 최적화

Databricks AI Search에서 Nori 미지원 문제를 해결하기 위해 Kiwi 형태소 분석기를 도입했습니다. 색인 전 토큰화와 동의어 확장으로 한국어 BM25 검색 성능을 높인 과정을 다룹니다.

6월 28, 2026 · 1 분 · Junho Lee
AI 전환 5단계와 Verification Tax 극복 전략

AI 전환 5단계와 Verification Tax 극복 전략

기업의 AI 전환 5단계 흐름과 자동화 효율을 저해하는 Verification Tax의 실체를 분석하고 실무 대응 전략을 제시합니다.

6월 26, 2026 · 1 분 · Junho Lee
agentdir: AI 에이전트 작업 공간 정돈

agentdir: AI 에이전트 작업 공간 정돈

agentdir는 AI 에이전트가 원본 파일을 건드리지 않게 돕습니다. 원본 폴더는 그대로 유지하고, 목적에 맞게 재배치한 읽기 전용 가상 파일 트리를 만듭니다. CoW 파일시스템은 대용량 데이터셋도 추가 디스크 없이 효율적으로 다룹니다.

6월 26, 2026 · 2 분 · Junho Lee
LLM Graph Builder: 비정형 데이터를 지식 그래프로 구조화하는 오픈소스 도구

LLM Graph Builder: 비정형 데이터를 지식 그래프로 구조화하는 오픈소스 도구

LLM Graph Builder는 PDF, 영상 등 비정형 데이터를 LLM으로 분석해 Neo4j 지식 그래프로 변환하는 오픈소스입니다. 노드와 관계를 추출하고 다양한 LLM과 질의 모드를 지원하며 복잡한 데이터 속에서 필요한 정보를 대화하듯 찾아줍니다.

6월 25, 2026 · 2 분 · Junho Lee
자연어로 SQL을 만드는 Gemini-SQL2, 정확도 80% 돌파의 의미

자연어로 SQL을 만드는 Gemini-SQL2, 정확도 80% 돌파의 의미

구글이 공개한 Gemini-SQL2가 BIRD 벤치마크 실행 정확도 80.04%를 기록하며 실무 적용 가능성을 입증했습니다. 전문 모델의 강점과 클라우드 생태계 통합 전망을 분석합니다.

6월 23, 2026 · 2 분 · Junho Lee
에이전트와 학습 루프로 일하는 AI-native 조직

에이전트와 학습 루프로 일하는 AI-native 조직

단순 업무를 에이전트에 맡기고 밤새 피드백을 학습해 제품을 개선하는 AI-native 기업의 새로운 운영 모델과 엔지니어의 역할 변화를 살펴봅니다.

6월 21, 2026 · 2 분 · Junho Lee
웹 브라우저에서 바로 그리는 SQL 기반 ERD 시각화 도구

웹 브라우저에서 바로 그리는 SQL 기반 ERD 시각화 도구

외부 서버 업로드 없이 웹 브라우저 자체 파싱으로 DDL 문법을 분석하여 즉시 ERD를 그려주는 로컬 실행형 시각화 도구를 소개합니다.

6월 16, 2026 · 2 분 · Junho Lee
클로드로 구현하는 셀프서비스 데이터 분석 에이전트 설계법

클로드로 구현하는 셀프서비스 데이터 분석 에이전트 설계법

글로벌 AI 개발사의 에이전트 맞춤형 데이터 스택 구축 노하우를 소개합니다. 데이터 웨어하우스 정제부터 시맨틱 레이어, 스킬셋 정의까지 에이전트 분석 정확도를 높이는 구체적인 엔지니어링 접근법을 다룹니다.

6월 7, 2026 · 2 분 · Junho Lee
수십 년간 쌓아온 문서 기술이 깃허브 트렌딩 1위에 오른 배경

수십 년간 쌓아온 문서 기술이 깃허브 트렌딩 1위에 오른 배경

국내 소프트웨어 기업의 추출 도구가 세계적인 개발자 플랫폼에서 1위를 차지했습니다. 완성된 제품을 넘어 핵심 역량을 오픈소스로 공개한 판단이 주효했습니다. 오랜 시간 다듬어온 문서 체계를 글로벌 표준 인프라로 전환한 과정을 살폈습니다.

4월 30, 2026 · 2 분 · Junho Lee

5. 메타데이터 유지보수를 자동화하는 방법: Karpathy의 LLM Wiki 구조

RAG는 매번 처음부터 답을 찾습니다. Karpathy는 LLM이 위키를 직접 유지보수하며 지식이 쌓이는 구조를 제안했습니다. DataNexus의 온톨로지 카탈로그가 방치되지 않으려면 같은 원리가 필요합니다.

4월 5, 2026 · 3 분 · Junho Lee
대용량 엑셀 다운로드를 위한 Spring Boot 최적화 기법

대용량 엑셀 다운로드를 위한 Spring Boot 최적화 기법

100만 건 엑셀 다운로드에서 OOM 없이 스트리밍 처리하는 Spring Boot 라이브러리. 어노테이션 하나로 보일러플레이트를 걷어냅니다.

4월 1, 2026 · 1 분 · Junho Lee
defuddle로 웹페이지를 변환하며 마주한 의외의 벽

defuddle로 웹페이지를 변환하며 마주한 의외의 벽

RAG 파이프라인에 쓸 웹 데이터를 defuddle로 뽑아봤더니 사이트 구조에 따라 결과가 크게 달랐습니다. 시맨틱 HTML이 무너진 사이트에서는 본문과 광고가 섞이고, 동적 렌더링 환경에서는 내용 자체가 날아갑니다.

3월 31, 2026 · 2 분 · Junho Lee
데이터 전처리가 가르는 RAG 품질과 마크다운 변환 도구 활용법

데이터 전처리가 가르는 RAG 품질과 마크다운 변환 도구 활용법

PDF나 Word 파일을 LLM에 넣기 전에 표 구조와 제목 계층을 살려서 Markdown으로 바꿔주는 도구인데, 전처리 공수가 줄어드는 게 생각보다 큽니다.

3월 30, 2026 · 2 분 · Junho Lee

1. 클라우드 DW에서 Kimball은 여전히 유효한가

Synapse, BigQuery, Redshift로 오면서 DW 모델링 관점이 어떻게 달라졌는지 정리합니다. Kimball, Data Vault, One Big Table의 실무 판단 기준도 함께 다룹니다.

2월 19, 2026 · 5 분 · Junho Lee