💻데브노트소개
🤖

벡터 데이터베이스란? 임베딩 검색의 핵심 이해하기

데브노트 편집팀·2026.07.14·6분 읽기
X(트위터)
ADVERTISEMENT

AI 검색·추천·RAG의 뒤에는 거의 항상 벡터 데이터베이스가 있습니다. 키워드가 아니라 의미로 검색하기 때문입니다.

임베딩: 의미를 숫자로

임베딩 모델은 텍스트(또는 이미지)를 수백~수천 차원의 숫자 배열로 바꿉니다. 핵심은 의미가 비슷하면 벡터도 가깝다는 성질입니다.

"강아지"  -> [0.21, -0.08, 0.55, ...]
"개"      -> [0.20, -0.07, 0.54, ...]  (강아지와 가까움)
"자동차"  -> [-0.6, 0.33, -0.1, ...]   (멀리 떨어짐)

그래서 "멍멍이"로 검색해도 "강아지" 문서를 찾을 수 있습니다. 키워드 일치가 아닌 의미 일치입니다.

일반 DB와의 차이

구분일반 DB벡터 DB
검색 방식정확 일치·범위유사도(거리)
질의WHERE name='개'"이 벡터와 가까운 것"
강점정형 데이터의미·유사성

유사도 검색의 원리

질문을 같은 임베딩 모델로 벡터화한 뒤, 코사인 유사도나 유클리드 거리로 가장 가까운 항목을 찾습니다. 데이터가 많으면 전수 비교가 느리므로 ANN(근사 최근접 이웃) 알고리즘(HNSW 등)으로 빠르게 근사합니다.

대표 도구

  • pgvector: PostgreSQL 확장. 기존 DB에 벡터 검색 추가
  • Pinecone: 관리형 벡터 DB 서비스
  • Chroma / Qdrant / Weaviate: 오픈소스 벡터 DB
-- pgvector 예시
SELECT content FROM docs
ORDER BY embedding <=> '[0.21, -0.08, ...]'  -- 코사인 거리
LIMIT 5;

마무리 체크리스트

  • 임베딩 = 의미를 숫자 벡터로
  • 의미가 비슷하면 벡터 거리도 가깝다
  • 검색은 유사도(ANN) 기반
  • 가볍게 시작하려면 pgvector

벡터 DB를 이해하면 "AI가 어떻게 의미로 검색하는가"의 비밀이 풀립니다.

#벡터DB#임베딩#AI#검색
X(트위터)
ADVERTISEMENT