
RAG / DATA QUALITY
RAG 구축을 위한 사내 문서 준비 가이드
검색 증강 생성의 품질은 모델 선택보다 문서의 신뢰도와 접근 규칙에 크게 좌우됩니다. 수집 전에 정리해야 할 기준을 단계별로 살펴봅니다.
1. 파일 수집보다 문서 인벤토리가 먼저
공유 드라이브 전체를 곧바로 색인하면 중복본, 폐기된 규정, 개인 메모가 함께 검색됩니다. 먼저 업무 질문에 답하는 데 필요한 문서군을 정하고 각 문서의 원본 위치, 소유 부서, 형식, 갱신 주기, 민감도, 예상 사용자를 기록합니다.
초기 범위는 한 부서 또는 한 업무로 제한하는 편이 좋습니다. 고객지원이라면 제품 매뉴얼, 최신 FAQ, 환불 규정처럼 답변 근거가 분명한 자료를 우선하고 회의록이나 초안은 별도 후보군으로 둡니다. 이렇게 해야 검색 실패가 기술 문제인지 원본 자료 문제인지 구분할 수 있습니다.
2. 문서 권한과 최신 버전을 검색 단계에 반영하기
사용자가 열 수 없는 문서의 내용이 답변에 노출되면 편리함보다 큰 위험이 생깁니다. 부서, 직무, 프로젝트 등 기존 권한 체계를 문서 메타데이터로 옮기고 검색할 때 사용자 권한으로 필터링해야 합니다. 개인정보나 계약 정보는 마스킹, 별도 저장, 색인 제외 중 적절한 방식을 선택합니다.
충돌하는 문서를 다루는 기준
- 시행일과 만료일을 기록해 현재 유효한 문서를 우선합니다.
- 공식 규정, 승인된 매뉴얼, 작업 메모 순으로 신뢰 등급을 구분합니다.
- 같은 제목의 사본은 원본 식별자로 연결하고 검색 대상에서는 하나만 유지합니다.
- 근거가 충돌하면 임의로 결론 내리지 않고 담당자 확인을 요청하게 합니다.
3. 제목과 표를 보존하며 의미 단위로 나누기
고정된 글자 수만으로 문서를 자르면 질문과 답이 다른 조각으로 떨어질 수 있습니다. 장, 절, 항목의 계층을 유지하고 표의 제목·열 이름이 데이터 행과 함께 검색되도록 변환해야 합니다. 이미지 기반 PDF는 OCR 결과를 원본 페이지와 비교해 숫자, 단위, 표의 열 순서를 확인합니다.
각 조각에는 문서명, 섹션 경로, 버전, 작성 부서, 원본 링크, 권한, 갱신일을 함께 저장합니다. 답변 화면에서도 출처 문서와 해당 위치로 이동할 수 있어야 사용자가 내용을 검증하고 잘못된 원본을 수정할 수 있습니다. 부산에이투엠컴퍼니의 전체 데이터·AI·실행 연결 구조는 Technology 페이지에서 확인할 수 있습니다.
4. 실제 질문으로 검색과 답변을 따로 평가하기
데모 질문 몇 개가 잘 작동하는 것만으로 운영 품질을 판단하기는 어렵습니다. 현업 담당자가 실제로 받는 질문을 모아 정답 근거 문서, 반드시 포함할 내용, 포함하면 안 되는 내용을 기록합니다. 쉬운 질문뿐 아니라 표현이 모호한 질문, 여러 문서를 함께 봐야 하는 질문, 답이 없는 질문도 포함합니다.
두 단계 평가
- 검색 평가: 필요한 근거가 상위 결과에 포함되는지 확인합니다.
- 답변 평가: 검색된 근거만 사용했는지, 핵심 내용과 출처가 정확한지 확인합니다.
검색이 실패했는데 답변이 자연스럽다면 오히려 위험 신호입니다. 반대로 검색은 성공했지만 답변이 부족하면 프롬프트와 출력 형식을 조정할 수 있습니다. 단계를 나눠야 개선할 지점을 정확히 찾을 수 있습니다.
5. 갱신과 삭제까지 포함한 운영 흐름 만들기
문서는 계속 바뀌므로 최초 색인보다 이후 동기화가 중요합니다. 새 문서 승인, 변경 감지, 재색인, 만료 문서 삭제, 오류 알림의 담당자와 주기를 정합니다. 사용자가 잘못된 답변을 신고하면 답변 자체뿐 아니라 검색 결과와 원본 문서까지 추적할 수 있어야 합니다.
- 대상 업무와 필수 문서군이 정해졌다.
- 문서별 소유자, 최신 버전, 유효 기간이 확인된다.
- 사용자 권한이 검색 결과에도 적용된다.
- 제목·표·출처를 보존하는 변환 기준이 있다.
- 실제 질문과 정답 근거로 만든 평가 세트가 있다.
- 변경·삭제·오류 신고를 반영하는 운영 담당자가 있다.
RAG를 실제 등록·응답·보고 업무로 연결하려면 AI Agent와 Workflow Automation 구성을 함께 검토해야 합니다. 준비 상태를 빠르게 확인하려면 AI 자동화 도입 체크리스트도 활용해 보세요.