검색 데이터 수집

원본 보기

검색 데이터 수집

참고

이 페이지는 검색 사용 사례에 특화된 수집 방법을 다룹니다. 다른 사용 사례를 다루고 있다면 수집 개요에서 더 많은 옵션을 확인하세요.

검색 사용 사례는 보통 일반 콘텐츠, 즉 타임스탬프가 없는 텍스트 위주의 데이터에 초점을 맞춥니다. 지식 베이스, 웹사이트 콘텐츠, 제품 카탈로그 등이 여기에 해당합니다.

Elastic 배포 방식을 정했다면, 다음 단계는 콘텐츠를 Elasticsearch로 가져오는 것입니다. 어떤 수집 방법을 선택할지는 콘텐츠가 어디에 있고 어떻게 접근해야 하는지에 따라 달라집니다.

검색 사용 사례를 위해 Elasticsearch로 데이터를 수집하는 방법은 여러 가지가 있습니다. 요구 사항에 맞춰 하나 이상을 선택하세요:

  • 네이티브 API 및 언어 클라이언트: Elasticsearch REST API 또는 Python, Java, Go 등 언어별 공식 클라이언트를 사용해 JSON 문서를 직접 색인합니다.
  • 웹 크롤러: 공개 또는 비공개 웹사이트의 콘텐츠를 수집해 검색 가능하게 만듭니다.
  • 엔터프라이즈 커넥터: 사전 구축된 커넥터를 사용해 SharePoint, Confluence, Jira 같은 외부 콘텐츠 소스와 MongoDB, PostgreSQL 같은 데이터베이스의 데이터를 Elasticsearch로 동기화합니다.

간단히 테스트해 보고 싶다면 UI를 사용해 샘플 데이터를 Elasticsearch 클러스터에 로드할 수 있습니다.

_bulk API를 사용하면 Elasticsearch 클라이언트 라이브러리를 포함한 모든 HTTP 클라이언트로 Elasticsearch 인덱스에 데이터를 추가할 수 있습니다.

Elasticsearch Serverless 프로젝트에 연결하려면 연결 정보를 확인해야 합니다.

Elasticsearch API는 모든 데이터 유형에 사용할 수 있지만, Elastic은 특정 사용 사례에 맞춰 수집을 최적화하는 전용 도구도 제공합니다.

이러한 전용 도구를 사용해 Elasticsearch 인덱스에 일반 콘텐츠를 추가할 수 있습니다.

방법 설명 비고
Elastic Open Web Crawler 웹사이트와 지식 베이스의 콘텐츠를 프로그래밍 방식으로 탐색하고 색인 공개된 웹 콘텐츠 또는 HTTP 프록시로 접근 가능한 내부 사이트를 크롤링
콘텐츠 커넥터 데이터베이스, 클라우드 스토리지, 비즈니스 애플리케이션 등 널리 쓰이는 콘텐츠 소스와의 서드파티 연동 Elastic이 제공하는 다양한 커넥터 중에서 선택하거나 Elastic 커넥터 프레임워크를 사용해 Python으로 직접 구축
파일 업로드 UI를 통한 일회성 수동 업로드 테스트나 아주 소규모 사용 사례에 유용하지만 프로덕션 워크플로에는 권장하지 않음

인제스트 파이프라인을 사용해 수집 시점에 콘텐츠를 변환하고 보강할 수도 있습니다.

Elastic UI에는 검색 사용 사례에 최적화된 인덱스를 생성하고 관리하는 도구가 마련되어 있습니다. 이 UI에서 인제스트 파이프라인도 관리할 수 있습니다. 자세한 내용은 검색 사용 사례를 위한 인제스트 파이프라인에서 확인하세요.