How we index images for RAG
RAG(검색 증강 생성) 시스템에서 이미지를 효과적으로 활용하기 위해, 쿼리 시점(query-time)에 이미지를 처리하는 대신 인덱싱 시점(indexing-time)에 이미지를 텍스트 설명으로 변환하여 저장하는 방식이 비용 효율적이며 성능 면에서 훨씬 우수하다는 연구 결과를 제시합니다.
이는 이미지에 대한 설명(캡션)을 미리 생성하고 이를 일반 텍스트 청크와 함께 저장함으로써, LLM이 픽셀을 재검토할 필요 없이 텍스트 기반으로 답변을 생성하게 하여 쿼리당 비용을 1%에서 6%까지 절감하고 답변 품질을 크게 향상시킵니다.
성공적인 구현을 위해서는 이미지에 대한 캡션 품질을 높이기 위해 주변 텍스트(context)를 활용하는 것이 중요하며, 또한 노이즈를 제거하고 문맥을 파악하는 분류기(classifier)를 사용하여 이미지의 정확도를 보장해야 합니다.
이는 이미지에 대한 설명(캡션)을 미리 생성하고 이를 일반 텍스트 청크와 함께 저장함으로써, LLM이 픽셀을 재검토할 필요 없이 텍스트 기반으로 답변을 생성하게 하여 쿼리당 비용을 1%에서 6%까지 절감하고 답변 품질을 크게 향상시킵니다.
성공적인 구현을 위해서는 이미지에 대한 캡션 품질을 높이기 위해 주변 텍스트(context)를 활용하는 것이 중요하며, 또한 노이즈를 제거하고 문맥을 파악하는 분류기(classifier)를 사용하여 이미지의 정확도를 보장해야 합니다.