본문 바로가기
SEO·GEO 용어사전

AI 가드레일 (AI Guardrails)

마지막 업데이트

AI 서비스에 가드레일이 필요하다는 이야기를 들으면 유해한 답변을 막는 필터부터 떠올리기 쉽습니다. 하지만 가드레일이 확인하는 곳은 답변의 마지막 단계만이 아닙니다.

AI 가드레일은 AI가 정해 둔 정책을 벗어나지 않도록 입력, 검색 자료, 도구 호출과 출력을 검사해 허용하거나 바꾸거나 차단하는 장치입니다. 어떤 위험을 검사하고 어떻게 처리할지는 서비스마다 다릅니다.

이 글은 NVIDIA NeMo Guardrails와 카카오의 공식 문서를 기준으로 작성했습니다.

입력부터 출력까지 놓이는 검사 장치

AI 가드레일은 하나의 필터 이름이 아닙니다. AI가 요청을 받고 답을 내놓는 흐름의 여러 지점에 둘 수 있는 검사 장치를 묶어 부르는 말입니다.

사용자 입력부터 AI 출력까지 가드레일이 검사하는 네 지점
AI 가드레일이 작동하는 위치

대표적으로 네 지점에서 확인합니다.

  • 입력 검사: 사용자의 질문에 유해한 내용, 개인정보나 프롬프트 공격이 들어 있는지 봅니다
  • 검색 자료 검사: RAG가 찾은 문서 조각에 민감한 정보나 허용하지 않은 자료가 섞였는지 확인합니다
  • 도구 호출 검사: AI가 호출하려는 도구와 입력값, 도구가 돌려준 결과가 허용된 범위인지 봅니다
  • 출력 검사: 생성한 답에 유해한 표현, 개인정보나 근거 없는 주장이 있는지 확인합니다

검사 결과는 통과와 차단으로만 갈리지 않습니다. 전화번호를 가린 뒤 통과시키거나, 허용된 답으로 바꾸거나, 사람의 검토로 보내는 방식도 가능합니다.

NVIDIA의 NeMo Guardrails는 이 흐름을 입력, 검색, 대화, 실행과 출력 단계로 나눕니다. 이는 공개된 대표 구현의 한 예입니다. ChatGPT, Gemini, Claude와 Perplexity가 모두 같은 순서와 규칙을 쓴다는 뜻은 아닙니다.

사내 RAG에서 볼 수 있는 작동 예시

사내 규정을 답해 주는 AI를 예로 들어보겠습니다. 사용자가 다른 부서의 연봉 규정을 알려 달라고 묻습니다.

  1. 입력 가드레일이 질문에 권한 밖 정보 요청이 있는지 봅니다
  2. 검색 시스템이 질문과 관련된 문서 조각을 찾습니다
  3. 검색 가드레일이 사용자의 부서와 문서 권한을 비교해 볼 수 없는 자료를 제외합니다
  4. AI가 남은 자료로 답을 만듭니다
  5. 출력 가드레일이 개인정보와 근거 표시를 다시 확인합니다

이 예시에서 관련 문서를 찾는 일은 검색 시스템이 맡고, 그 문서를 답에 써도 되는지 확인하는 일은 가드레일이 맡습니다. 검색과 가드레일의 역할이 갈리는 지점입니다.

다만 검색 단계에서 문서를 제외했다고 접근 제어가 완성되는 것은 아닙니다. 중요한 권한은 원본 저장소와 API에서도 따로 막아야 합니다. 가드레일은 보안 체계 전체를 대신하는 장치가 아닙니다.

할루시네이션 검사와 콘텐츠 모더레이션의 차이

AI 안전과 관련된 말은 범위가 겹쳐 보입니다. 어떤 대상을 검사하는지 보면 차이를 나누기 쉽습니다.

용어주로 확인하는 것AI 가드레일과의 관계
콘텐츠 모더레이션폭력, 혐오, 성적 내용 같은 유해 콘텐츠입력 또는 출력 가드레일로 넣을 수 있음
할루시네이션 검사답이 근거와 맞는지, 사실을 지어냈는지출력 가드레일의 한 종류가 될 수 있음
그라운딩답을 외부 근거와 연결하는 과정가드레일이 근거와 답의 일치 여부를 확인할 수 있음
접근 권한 제어누가 어떤 자료와 기능을 쓸 수 있는지검색과 도구 호출 가드레일에 일부 반영할 수 있음

카카오는 Safeguard by Kanana에서 사용자 발화와 AI 답변의 유해 표현, 전문 조언과 개인정보 위험, 프롬프트 인젝션을 서로 다른 모델로 탐지한다고 설명합니다. 하나의 가드레일 제품 안에서도 검사 대상이 여러 갈래로 나뉘는 실제 사례입니다.

AI 검색에서 가드레일을 알아야 하는 이유

AI 검색은 관련 페이지를 찾았다고 그 내용을 모두 답에 쓰지 않습니다. 검색한 자료가 정책과 권한 검사에서 제외될 수 있고, 초안에 들어간 문장도 출력 검사에서 바뀌거나 빠질 수 있습니다.

따라서 크롤링, 색인과 검색 후보 선정만으로 최종 인용을 설명할 수는 없습니다. 발견된 페이지, 검색 후보가 된 페이지와 최종 답에 쓰인 페이지는 서로 다른 단계의 결과입니다.

여기서 한계도 분명합니다. 공개 AI 검색 서비스는 가드레일의 전체 규칙과 검사 로그를 사이트 운영자에게 보여 주지 않습니다. 특정 문장 형식으로 쓰면 가드레일을 통과해 인용된다는 공식도 확인되지 않았습니다.

사이트 운영자가 할 일은 가드레일을 공략하는 것이 아닙니다. 출처와 날짜가 분명한 정보를 제공하고, 위험하거나 중요한 주장에는 근거를 붙이며, 공개하면 안 되는 자료는 애초에 접근을 막아야 합니다.

자체 AI 서비스에서 확인할 항목

가드레일을 직접 운영한다면 차단 건수만 보지 마세요. 무엇을 잘못 막았는지까지 함께 봐야 합니다.

  • 어떤 단계에서 어떤 규칙이 실행됐는지 확인합니다
  • 허용, 변경, 차단과 사람 검토 결과를 나눠 기록합니다
  • 위험한 요청을 놓친 비율과 정상 요청을 잘못 막은 비율을 함께 봅니다
  • 검색 자료가 제외됐을 때 답에 필요한 근거까지 사라지지 않았는지 확인합니다
  • 정책과 모델을 바꾼 뒤 같은 평가 질문으로 다시 시험합니다

정상 질문까지 많이 막으면 AI는 안전해 보이지만 쓸모가 떨어집니다. 반대로 통과율만 높이면 위험한 요청을 놓칠 수 있습니다. 실제 업무 질문과 공격 사례를 함께 넣은 평가 세트가 필요한 이유입니다.

자주 묻는 질문

AI 가드레일을 쓰면 할루시네이션이 없어지나요?

아닙니다. 근거 확인과 할루시네이션 탐지 가드레일로 오류를 줄일 수는 있지만, 검색 자료가 틀리거나 검사 자체가 놓칠 수 있습니다. 중요한 사실은 원문과 다시 대조해야 합니다.

가드레일은 모델 안에 들어 있나요?

구현에 따라 다릅니다. 별도 분류 모델과 규칙, 프롬프트, 외부 API를 조합할 수 있고, 애플리케이션과 LLM 사이에서 작동하기도 합니다. 하나의 고정된 구성만 가드레일이라고 부르는 것은 아닙니다.

공개 웹페이지도 AI 가드레일 때문에 인용에서 빠질 수 있나요?

가능성은 있지만 특정 페이지가 어떤 규칙 때문에 빠졌는지는 보통 확인할 수 없습니다. 검색 후보 선정, 품질 판단과 가드레일이 모두 영향을 줄 수 있으므로 인용되지 않았다는 결과만으로 원인을 가드레일이라고 단정하면 안 됩니다.

SEO 담당자가 가드레일을 설정할 수 있나요?

자체 RAG나 사내 챗봇이라면 개발팀과 함께 정책과 평가 기준을 정할 수 있습니다. ChatGPT나 Gemini 같은 외부 서비스의 내부 가드레일은 사이트 운영자가 설정할 수 없습니다.

함께 알아두면 좋은 용어

  • 할루시네이션: AI가 근거 없는 사실이나 출처를 만들어 내는 오류
  • RAG: 질문과 관련된 외부 자료를 검색해 답변에 제공하는 구조
  • 그라운딩: 생성한 답을 확인 가능한 근거와 연결하는 과정
  • 프롬프트 인젝션: AI가 기존 지시를 무시하도록 유도하는 공격

참고 문서