메인 콘텐츠로 건너뛰기

Data Map 이해하기

Perplexity가 쿼리 정확도 향상을 위해 Snowflake 또는 Databricks 데이터에 대한 Data Map을 자동으로 생성하는 방법을 알아보세요.

작성자: Emilio Morales

Snowflake 또는 Databricks를 Perplexity에 연결하면 Computer가 데이터 맵 데이터 웨어하우스 또는 레이크하우스의 정보입니다. Data Map은 데이터 모델에 대한 핵심 정보 — 주요 테이블 및 컬럼, 일반적인 쿼리 패턴, 객체 간의 관계 — 를 캡처하여 Computer가 자연어 질문을 정확한 쿼리로 변환할 수 있도록 합니다.

 

이를 Computer가 무엇이 어디에 위치하며 일반적으로 어떻게 사용되는지 이해하도록 돕는 데이터 환경의 지도로 생각하십시오. 일단 생성된 Data Map은 시간이 지남에 따라 지속적으로 개선됩니다. 사용자 피드백을 통해 학습하고, 관리자가 직접 편집할 수 있으며, 버전이 관리되므로 변경 사항을 언제든지 검토하고 이전 상태로 되돌릴 수 있습니다.

 

작동 방식

Data Map 생성이 시작되면 Computer는 연결된 계정의 권한을 사용하여 사용자의 데이터 모델을 탐색합니다. 이 프로세스는 스키마, 테이블, 뷰 및 과거 사용 패턴을 검토하여 데이터에 대한 포괄적인 이해를 구축합니다.

 

데이터 맵은 소속 조직의 멤버만 접근할 수 있는 조직별 버전 관리 저장소에 안전하게 저장됩니다. 재생성, 관리자 편집, 자가 학습 업데이트 등 모든 변경 사항은 검토 및 롤백이 가능하도록 기록됩니다.

 

데이터 맵 생성

있습니다 조직당 1개의 Data Map, 해당 조직의 모든 구성원이 공유합니다. 관리자가 생성을 실행하면 단일 사용자가 아닌 조직 전체를 대신하여 수행됩니다.

 

Snowflake

Snowflake용 데이터 맵 생성은 조직 관리자가 Snowflake 커넥터 설정에서 시작합니다. Perplexity는 두 종류의 Snowflake 커넥터를 제공하며, 관리자는 조직에서 구성한 커넥터에서 데이터 맵을 생성합니다:

  • Snowflake (키 쌍 또는 PAT) — 쿼리가 설정된 서비스 계정으로 실행됩니다.

  • Snowflake (사용자 OAuth) — 생성을 시작한 관리자의 Snowflake 식별 정보로 쿼리가 실행됩니다.

사용되는 ID는 Snowflake의 account-usage 뷰를 읽을 수 있어야 합니다 (다음 참조 요구 사항 아래). 해당 권한 부여가 누락된 경우, 부분적인 Data Map을 생성하는 대신 명확한 권한 오류와 함께 즉시 생성이 실패합니다.

 

Databricks

Databricks의 경우, 생성은 초기화 작업자의 Databricks OAuth ID를 사용하여 커넥터 설정에서 시작됩니다. Computer는 사용자가 Unity Catalog에서 볼 수 있는 카탈로그, 스키마, 테이블을 나열하고 사용량 신호를 확인하기 위해 Databricks 시스템 테이블을 읽습니다. 초기화 작업자가 Unity Catalog에서 볼 수 있는 항목들이 Data Map에 최종적으로 포함될 내용을 정의합니다.

 

추가 컨텍스트 (Snowflake 및 Databricks)

추가할 수 있습니다 추가 컨텍스트 — 파일을 업로드하거나 데이터(예: 주요 테이블이 나타내는 의미, 비즈니스 정의, 일반적인 쿼리 패턴)를 설명하는 노트를 추가하여 — Computer가 데이터를 더 정확하게 해석하도록 돕습니다. 보충 컨텍스트는 모든 생성 실행에 입력되며 재생성의 영향을 받지 않음, 따라서 손실 걱정 없이 시간이 지나도 계속해서 내용을 추가할 수 있습니다.

 

지식 보기

생성이 완료된 후, 데이터 맵 생성 커넥터 모달의 버튼이 다음과 같이 변경됩니다 지식 보기. 클릭하면 지식 보기 을(를) 엽니다 데이터 맵 에디터, 관리자가 Computer가 사용자의 데이터에 대해 학습한 모든 내용을 탐색, 수정 및 관리할 수 있는 곳입니다. 데이터 맵 재생성 초기 Data Map이 생성된 후에는 커넥터 모달에서도 이용할 수 있습니다 — 다음을 참조하세요 데이터 맵 재생성 수행하는 역할 및 보존되는 항목에 대해.

 

얼마나 걸리나요?

데이터 맵을 생성하는 데는 최대 90분, 데이터 웨어하우스 또는 레이크하우스의 규모와 복잡성에 따라 달라집니다. 페이지를 계속 열어둘 필요는 없습니다 — 프로세스는 백그라운드에서 실행되며 지식 보기 완료되면 커넥터 모달에 버튼이 나타납니다.

 

데이터 맵 에디터

Data Map Editor는 조직 관리자 도구에서 액세스할 수 있는 Data Map의 관리자용 뷰입니다. Snowflake 및 Databricks 지식을 별도의 섹션으로 구분하며, 근간이 되는 비즈니스 컨텍스트, 테이블 클러스터 및 쿼리 패턴은 직접 읽고 편집할 수 있는 파일 형태로 구성됩니다.

 

에디터에서 관리자는 다음을 할 수 있습니다:

  • 둘러보기 전체 Data Map — 비즈니스 컨텍스트, 테이블 클러스터, 일반적인 쿼리 패턴.

  • 수정 파일을 직접 수정합니다. 저장된 수정 사항은 실시간 Data Map에 즉시 적용되어 새로운 기준 데이터가 되며; 검토 파이프라인을 거칠 필요가 없습니다.

  • AI가 제안한 변경 사항을 검토하고 조치하십시오 자가 학습 파이프라인에서. 관리자는 승인 제안(변경 사항은 Data Map에 적용됨) 또는 거절 해당 제안은 폐기됩니다. 현재 승인 전에 제안 내용을 즉시 수정하는 기능은 지원되지 않습니다 — 다른 결과를 원하는 관리자는 제안을 거절한 후 직접 수정할 수 있습니다.

  • 버전 기록 보기 모든 파일의 내역을 확인하고 필요한 경우 이전 상태로 되돌릴 수 있습니다.

에디터에서의 직접 수정 사항은 일반적인 사용 시 유지되지만, 자동 생성된 콘텐츠와 함께 존재하며 해당 웨어하우스의 데이터 맵을 다시 생성할 경우 보존되지 않습니다. — 참조 데이터 맵 재생성 아래를 참조하십시오.

 

피드백을 통한 자가 학습

Data Map은 팀이 더 많이 사용할수록 성능이 향상됩니다. 사용자가 세션에서 데이터 에이전트를 수정할 때 — 예를 들어 "use" fct_queries 대신 query_events 쿼리 횟수용" 또는 "제외 type = 'internal' 쿼리량 지표로부터" — Computer가 해당 피드백을 수집하여 모든 사용자를 위해 Data Map을 개선하는 데 사용합니다.

 

파이프라인은 ~하도록 설계되었습니다 안전, 검토 가능, 및 조직 전체에서 공유됨:

 

1. 피드백 수집

사용자가 Data Scientist 세션에서 피드백을 제공하면, Computer는 영향받는 파일, 섹션, 제안된 변경 사항 및 이를 생성한 세션 컨텍스트를 포함한 구조화된 수정 사항을 기록합니다. Data Map 자체는 사용자 세션에서 실시간으로 직접 수정되지 않으며, 피드백은 항상 이 로그에 먼저 기록됩니다.

 

2. 제안된 업데이트로 매일 압축

Computer는 하루에 한 번 각 조직에 대해 지난 24시간 동안 기록된 수정 사항을 검토하여 하나의 통합된 제안된 업데이트 데이터 맵으로:

  • 동일한 영역에 대한 여러 차례의 수정은 병합됨 한 번의 편집으로.

  • 상충하는 수정 사항 (예: 하나는 "항상 cron jobs를 포함," 다른 하나는 "항상 cron jobs를 제외"라고 하는 경우)는 인적 검토를 위해 별도 분류됨 자동으로 해결 처리되는 대신.

  • 각 수정 사항은 올바른 창고로 배정됨 — Snowflake 전용 수정 사항은 Databricks Data Map에 영향을 미치지 않으며, 그 반대의 경우도 마찬가지입니다.

  • 확신을 가지고 병합하거나 라우팅할 수 없는 수정 사항은 자동으로 적용되는 대신, 관리자가 검토할 수 있도록 플래그가 지정됩니다.

결과는 관리자가 검토할 수 있는 단일 제안으로 Data Map Editor에 표시됩니다.

 

3. 관리자 검토

관리자 승인 제안(변경 사항이 Data Map에 적용됨) 또는 거절 제안은 폐기됩니다. 승인을 통해 변경 사항이 "배포"되며, 팀이 다음에 질문하는 데이터 관련 문의에는 업데이트된 Data Map이 사용됩니다. 별도의 게시 단계는 없습니다.

이러한 human-in-the-loop 패턴은 의도된 것입니다. 이는 관리자가 무엇을 ground truth로 신뢰할지에 대한 제어권을 유지하는 동시에, Computer가 실제 사용 사례로부터 지속적으로 학습할 수 있도록 합니다.

 

누가 무엇을 할 수 있나요?

  • 모든 사용자 Data Scientist 세션에서 피드백을 제공하면 다음 날 제안되는 업데이트에 반영될 수 있습니다.

  • 조직 관리자 Data Map 파일을 직접 탐색 및 편집할 수 있으며, Data Map Editor에서 매일 제안되는 업데이트를 승인하거나 거부할 수 있습니다.

  • 있습니다 조직당 1개의 Data Map — 조직의 모든 구성원이 동일한 공유 Data Map을 대상으로 쿼리합니다. 사용자별 Data Map은 존재하지 않습니다.

 

 

데이터 맵 재생성

관리자는 실행할 수 있습니다 데이터 맵 재생성 커넥터 모달에서 언제든지 가능합니다. 현재, 재생성은 다시 생성하는 웨어하우스를 처음부터 다시 구축:

  • 해당 웨어하우스의 데이터 맵이 새로운 결과로 완전히 교체됩니다. 해당 웨어하우스의 데이터 맵에 대한 관리자의 수동 편집 사항은 유지되지 않습니다.

  • 해당 다른 창고의 Data Map은 그대로 유지됩니다 — Snowflake를 재생성해도 Databricks에 영향을 미치지 않으며, 그 반대의 경우도 마찬가지입니다.

  • 추가 컨텍스트 유지되어 새로운 실행에 다시 적용됩니다.

  • 피드백 대기 중 (당일 기록되었으나 아직 제안된 업데이트에 통합되지 않은 수정 사항)은 보존됩니다. 이미 승인되어 Data Map에 적용된 피드백은 교체되는 대상에 포함됩니다.

  • 전체 버전 기록이 보존되므로 Data Map의 이전 버전을 계속해서 검토할 수 있습니다.

재생성 채팅은 웨어하우스의 Data Map 및 관리자의 모든 수정 사항을 대체하므로, 의도적으로 실행해야 합니다. 관리자 편집 내용을 보존하는 보다 안전한 재생성 기능과 별도의 명시적인 "전체 초기화" 기능은 로드맵에 포함되어 있으나, 현재 제품에는 아직 반영되지 않았습니다.

 

요구 사항

Snowflake

Data Map을 생성하는 데 사용되는 ID — 키 페어 / PAT 인증을 위한 서비스 계정 또는 OAuth 인증을 위한 요청 관리자의 Snowflake 사용자 — 는 다음 두 뷰를 모두 읽을 수 있어야 합니다. 위치: SNOWFLAKE.ACCOUNT_USAGE 스키마:

  • SNOWFLAKE.ACCOUNT_USAGE.QUERY_HISTORY

  • SNOWFLAKE.ACCOUNT_USAGE.ACCESS_HISTORY (Snowflake Enterprise Edition 이상)

중요: 계정 사용량 기본적으로 관리자 전용입니다. 생성이 실패하는 가장 일반적인 원인은 일반 데이터베이스는 읽을 수 있지만 다음에 대한 액세스 권한이 없는 역할 때문입니다 계정 사용량. 해결 방법은 권한을 부여하는 것입니다 가져온 권한 ~의 SNOWFLAKE 데이터베이스.

초기 설정 중에 아직 이 권한을 부여하지 않으셨다면, 다음과 같이 실행하십시오 ACCOUNTADMIN:

GRANT IMPORTED PRIVILEGES ON DATABASE SNOWFLAKE TO ROLE <your_role>;

그런 다음 연결 역할에서 확인하십시오:

SELECT 1 FROM SNOWFLAKE.ACCOUNT_USAGE.QUERY_HISTORY LIMIT 1; SELECT 1 FROM SNOWFLAKE.ACCOUNT_USAGE.ACCESS_HISTORY LIMIT 1;

만약 액세스 기록 을 사용할 수 없는 경우(Snowflake Standard Edition), 생성이 다음으로 폴백됩니다 검색 기록 단독으로 사용됩니다. Data Map은 계속 작동하지만 컬럼 리니지 및 테이블 액세스 횟수에 대한 신호의 정밀도가 다소 낮아집니다.

 

전체 설정 지침은 다음을 참조하세요 Perplexity와 Snowflake 연결하기.

 

Databricks

Databricks 생성은 실행자의 OAuth ID를 사용하며 해당 사용자의 Unity Catalog 권한을 상속합니다 — 별도의 추가 권한 부여는 필요하지 않습니다. 몇 가지 실질적으로 알아두어야 할 사항은 다음과 같습니다:

  • Unity Catalog가 필요합니다. Computer는 쿼리 기록을 위해 Unity Catalog에 의존하는 Databricks 시스템 테이블을 읽습니다. 다음에서만 작동하는 워크스페이스는 hive_metastore 생성 중에 액세스 검사에 실패하게 됩니다.

  • A SQL 웨어하우스가 실행 중이어야 합니다 생성이 시작될 때입니다. 실행 중인 웨어하우스가 없는 경우, Databricks에서 먼저 하나를 시작하십시오.

  • 시작자가 Unity Catalog에서 볼 수 있는 내용에 따라 Data Map에 포함될 항목이 결정됩니다. 카탈로그나 스키마가 해당 사용자에게 숨겨져 있는 경우, Computer는 이를 포함할 수 없습니다.

전체 설정 지침은 다음을 참조하세요 Perplexity와 Databricks 연결하기.