임베딩은 텍스트, 이미지 같은 데이터를 숫자 벡터로 나타낸 표현입니다. 같은 임베딩 모델 안에서는 관련된 항목이 가까운 벡터가 되도록 학습할 수 있어 검색과 추천, 분류에 쓰입니다. 가까움의 의미와 품질은 모델과 학습 목적에 따라 달라집니다.
이 글은 OpenAI와 Google의 공식 문서를 기준으로 작성했습니다.
숫자 벡터의 실체
임베딩의 실체는 부동소수점 숫자가 길게 늘어선 배열입니다. OpenAI 공식 문서의 정의도 벡터, 즉 숫자 목록입니다. 몇 가지 성질을 알아 두면 뭉뚱그린 설명에 속지 않습니다.
- 벡터의 길이(차원 수)는 모델마다 정해져 있습니다. OpenAI의 text-embedding-3-small은 1,536차원, 3-large는 3,072차원입니다
- 두 텍스트의 관련성은 벡터 사이 거리로 잽니다. OpenAI는 코사인 유사도를 권장하는데, 유일한 방법은 아니고 정규화된 벡터에서는 다른 거리 계산도 같은 순위를 냅니다
- 임베딩은 사람이 손으로 만드는 값이 아니라 모델이 학습으로 만들어내는 값입니다. 글쓴이가 벡터 숫자를 직접 조정할 방법은 없습니다
검색 시스템이 임베딩으로 하는 일
키워드 검색은 질의어와 문서의 단어가 겹치는지를 봅니다. 임베딩 기반 검색은 질의와 문서를 같은 의미 공간의 벡터로 바꾼 뒤 거리가 가까운 문서를 찾습니다. 강아지 사료를 검색한 사람에게 반려견 먹이를 다룬 글이 잡히는 원리입니다. 이 방식 전반은 시맨틱 검색에서 다룹니다.
구글 검색에 대해서는 표현을 정확히 해야 합니다. 구글이 공식 블로그에서 밝힌 것은 2015년 RankBrain(단어와 개념의 관계 이해), 2018년 신경망 매칭(질의와 페이지의 개념을 통째로 매칭), 2019년 BERT(단어 조합이 만드는 의도 이해)라는 서로 다른 시스템이고, 이 중 신경망 매칭을 개념의 흐릿한 표현을 맞춰 보는 기술이라고 설명합니다. 임베딩과 같은 계열의 방식이라고 이해하면 맞지만, 구글이 임베딩이라는 단어로 자사 검색을 설명한 공식 문장은 확인되지 않습니다.
RAG 파이프라인 안의 위치
일부 RAG 구현에서 임베딩은 문서와 질문을 비교하는 단계입니다. 문서 조각과 질문을 같은 임베딩 모델로 바꿔 가까운 조각을 찾을 수 있습니다. 다만 RAG는 키워드 검색과 하이브리드 검색도 쓸 수 있고 벡터 전용 데이터베이스가 필수는 아닙니다.
이는 벡터 검색을 쓰는 특정 RAG 구현의 설명입니다. Google과 Naver, 모든 AI 검색이 웹페이지를 같은 조각과 벡터로 처리한다고 단정할 수 없습니다.
임베딩 최적화 주장의 실체
이 용어가 검색 실무와 만나는 지점을 정확히 그어 둡니다. 임베딩 최적화나 Vector SEO라는 이름의 서비스가 팔리고 있는데, 콘텐츠 제작자가 임베딩을 직접 최적화할 수 있다고 구글이나 OpenAI가 밝힌 공식 자료는 확인되지 않습니다. 벡터는 모델이 만드는 값이라 글쓴이가 손댈 수 있는 것은 벡터가 아니라 글 자체입니다.
실무에서는 자체 RAG의 검색 결과를 평가할 때 질문 벡터와 상위 문서, 거리 점수를 봅니다. 콘텐츠 제작자는 키워드와 의미를 정확히 설명하되, 임베딩 원리만으로 특정 문장 구조가 AI 인용에 유리하다고 주장하지 않습니다.
자주 묻는 질문
임베딩과 키워드 매칭은 뭐가 다른가요?
키워드 매칭은 단어의 겉모양이 겹치는지를 보고, 임베딩은 의미의 거리를 봅니다. 그래서 임베딩 기반 검색은 표현이 달라도 뜻이 같은 문서를 찾을 수 있고, 반대로 같은 단어를 써도 맥락이 다르면 멀게 판단할 수 있습니다.
마케터가 임베딩을 직접 다룰 일이 있나요?
대부분 없습니다. 임베딩은 검색엔진과 AI 서비스, 분석 도구가 내부에서 쓰는 기술입니다. 다만 AI 가시성 추적이나 콘텐츠 유사도 분석 도구가 임베딩 기반으로 작동하므로, 원리를 알면 도구의 결과를 해석하는 눈이 생깁니다.
구글 검색도 임베딩을 쓰나요?
구글은 자사 검색을 임베딩이라는 단어로 설명하지 않습니다. 공식 설명은 신경망 매칭이 질의와 페이지의 개념 표현을 매칭한다는 것까지이고, 이것이 임베딩과 같은 계열의 기술이라는 해석은 업계의 추론입니다. 방향은 맞지만 공식 확인과 해석을 구분해서 알아 두는 것이 정확합니다.
임베딩 최적화 서비스는 믿을 만한가요?
서비스가 실제로 하는 일이 무엇인지 확인해야 합니다. 콘텐츠 구조와 의미 커버리지를 개선한다면 이름만 새로울 뿐 유효한 작업이고, 벡터를 직접 조작해 인용을 보장한다는 주장이라면 공식 근거가 없는 마케팅입니다.
함께 알아두면 좋은 용어
- 시맨틱 검색: 임베딩이 만들어내는 의미 기반 검색
- RAG: 임베딩으로 근거 문서를 찾는 구조
- 청킹: 문서를 임베딩할 검색 단위로 자르는 전처리
- LLM: 텍스트를 생성하는 모델로, 임베딩 모델과 목적과 출력이 다름