Data 360 상호 운용성
기업은 종종 Salesforce 및 기타 외부 데이터 레이크(예: Snowflake, Google BigQuery, Databricks, Redshift 또는 _Amazon S3_과 같은 개체 저장소)에 데이터를 저장합니다. 여러 시스템에 분산된 데이터는 기업이 데이터의 전체 가치를 활용하여 AI 기반 경험을 구현하는 데 어려움을 겪게 만듭니다. Salesforce _Data 360_은 모든 Agentforce AI 에이전트가 적시에 올바른 컨텍스트에 액세스하기 위해 사용하는 기본 인텔리전스 계층입니다.
여러 데이터 레이크에서 데이터를 함께 가져오는 작업을 수행하는 아키텍트들은 해당 데이터를 가장 효과적으로 통합하는 방법에 대한 주요 아키텍처 결정에 직면하게 됩니다. Data 360은 데이터 통합을 위한 여러 옵션을 제공하며, 각각은 다양한 장단점을 제공합니다.
이 가이드는 데이터 통합 시 대기 시간, 비용, 확장성, 거버넌스, 복잡성에 대한 요구 사항에 가장 적합한 패턴을 평가하는 프레임워크를 제공하므로 데이터 수집, Zero Copy 데이터 연합 또는 하이브리드 접근 방식을 사용할 시기를 선택할 수 있습니다. 가이드는 각각 다른 요구를 충족하는 다양한 데이터 수집 및 데이터 연합 방법 중에서 선택하는 데도 도움이 됩니다.
외부 데이터 레이크 하우스를 _Data 360_과 통합하려면 데이터 신선도, 거버넌스 및 파이프라인 효율성 간의 상호 작용을 주의 깊게 고려해야 합니다. 예를 들어, Zero Copy 데이터 연합 실시간 쿼리를 사용하면 데이터의 신선도가 극대화되지만, 더 많은 데이터가 네트워크를 통해 이동하면 파이프라인 효율성이 저하될 수 있습니다. 대부분의 실제 구현에서 다중 클라우드 레이크 하우스 생태계에서 수집 및 연합을 결합하는 것이 최적의 경로입니다. 이 하이브리드 접근 방식은 저 대기 시간 운영 워크로드(예: 실시간 개인 설정 및 사기 감지) 및 분석 워크로드(예: 규제 보고 및 내역 추세 분석)를 지원하는 확장 가능, 관리 가능, 상호 운용 가능한 아키텍처를 보장합니다. 이 가이드는 적절한 전략을 사용하여 이러한 절충점을 조율하는 방법을 결정하는 데 도움을 줍니다.
- 데이터 수집은 데이터를 Salesforce _Data 360_에 복사하고, 관리되고 표준화된 데이터 모델을 생성합니다. 다음과 같은 경우에 적합합니다.
- 포괄적인 Customer 360 구축 이렇게 하면 서로 다른 소스를 통합하고 신뢰할 수 있는 단일 프로필로 변환할 수 있습니다.
- 엄격한 규정 준수를 준수하십시오. 이를 통해 감사 가능한 중앙 집중식 복사본을 만들어 데이터 액세스 및 계보를 면밀하게 제어할 수 있습니다.
- Zero Copy Federation은 중복 없이 실시간으로 외부 소스를 쿼리하여 실시간 개인화, 실시간 대시보드 및 신속한 소스 온보딩을 지원합니다. 이 접근 방식은 두 가지 기본 옵션을 제공하지만 균형을 맞추어야 하는 제약 사항이 있습니다.
- Live Query: 외부 데이터 플랫폼(예: Snowflake, BigQuery, Redshift 또는 Databricks)에 존재하는 대화형 분석 및 실시간 데이터 대시보드에 이를 사용합니다. 이렇게 하면 소스 시스템에 쿼리 처리를 푸시하고 필요한 결과만 반환하여 비용이 많이 드는 느린 데이터 중복을 방지할 수 있습니다. 이 접근 방식은 최신성이 중요한 드물거나 임시 쿼리에 최적화되어 있습니다. 낮은 초당 쿼리(QPS) 워크로드에 적합합니다(쿼리 비용은 QPS가 높을 때 크게 증가할 수 있습니다).
- 캐싱(고속 쿼리): 자주 변경되지 않는 데이터를 대상으로 하는 빈번한 쿼리에 사용합니다. 가속 쿼리는 구성 가능한 간격(15분~7일)으로 업데이트되는 로컬 캐시를 유지하므로 반복적인 소스 접근이 줄어듭니다. 이 접근 방식을 통해 대시보드 성능과 비용, 세분화, BI 워크로드의 균형을 맞추고 약간 오래된 결과를 사용할 수 있습니다. 이는 1초 미만의 의사결정에는 적합하지 않습니다.
- 파일 통합: 이를 사용하여 클라우드의 데이터 레이크(예: S3 또는 ADLS)의 데이터에 대한 대규모 배치 처리 및 AI 모델 교육을 수행할 수 있습니다. 이 접근 방식은 오픈 테이블 형식의 파일을 직접 쿼리하여 비용이 많이 드는 느린 데이터 수집을 방지하고, 대규모 ETL 데이터셋과 데이터 과학 워크로드를 활용할 수 있게 합니다.
- 하이브리드 모델은 _통합 프로필_을 위한 데이터 수집과 신선도를 위한 연합을 결합하여 옴니채널 참여, Agentforce 기반 작업, 그리고 AI/ML 교육을 지원합니다.
- 하이브리드 아키텍처를 사용하십시오. 데이터 수집 및 연합을 혼합해야 하는 경우가 많습니다.
- 정규 데이터 모델 및 핵심 거버넌스를 위해 중요한 데이터에 대한 _데이터 수집_을 사용합니다.
- 기타 모든 데이터 연합에는 _Zero Copy_를 사용하여 신선도를 유지하고 데이터 수집 파이프라인 구축 및 유지 관리에 필요한 운영 오버헤드를 최소화하십시오.
- 데이터 수집 주기는 중요합니다. 비즈니스 가치, 대기 시간 요구, 운영 복잡성을 기반으로 주기를 선택합니다.
- 시간에 민감한 워크플로에 _실시간_을 사용합니다(예: 개인 설정, 실시간 대시보드 및 Agentforce 작업).
- 약간 긴급한 프로세스(예: 캠페인 및 운영 보고서)에서 직접 실시간 사용
- 역사적 또는 저속 데이터셋에 배치 처리를 사용합니다.
- 연합 패턴을 지연 시간 및 성능에 맞춥니다. 액세스 패턴과 최신성, 성능, 비용에 대한 요구 사항에 가장 적합한 옵션을 선택하십시오.
- _Live Query_를 사용하여 운영 대시보드 및 실시간 개인화를 구현하십시오.
- 쿼리가 자주 발생하고 약간 오래된 결과가 허용되는 경우 _캐싱(고속 쿼리)_을 사용하여 성능과 비용의 균형을 맞추십시오.
- 대규모 처리량을 요구하는 분석 또는 배치 워크로드, 즉 역사적 또는 시간에 덜 민감한 데이터셋에는 _파일 연합_을 사용하십시오.
- 거버넌스와 데이터 거주 요구 사항을 조율합니다.
- 중앙 집중식 거버넌스가 중요할 때 _데이터 수집_을 사용하십시오.
- 분산된 거버넌스가 허용되는 경우, _federation_을 사용하고 외부 소스에서는 엄격한 거버넌스를 적용합니다.
- 소스 수준 정책(예: 행 수준 보안(RLS) 및 데이터 마스킹)에 대해 _제로 복사_를 사용합니다.
- 고가치 워크플로를 위한 데이터 수집 우선순위 지정. 중요한 프로세스(예: ID 확인, 규제 보고, 운영 활성화)에 선택적으로 수집을 적용합니다.
- 비용 및 복잡성이 의사 결정을 좌우합니다. 실시간 수집은 비싸고 복잡할 수 있습니다. 따라서 아키텍트들은 데이터 온보딩, 저장 및 변환 비용과 _Zero Copy_를 통한 직접 쿼리 비용을 비교해야 합니다.
올바른 통합 패턴(데이터 수집, 제로 복제 또는 하이브리드 접근 방식)을 선택하면 멀티 클라우드 플랫폼의 지연 시간, 거버넌스, 운영 효율성, 비용에 직접적인 영향을 미칩니다. 이 결정은 실시간 인사이트, AI 기반 활성화, 그리고 개인화된 참여가 신뢰할 수 있고 대규모로 전달되는 방식을 결정합니다.
이 표에서는 Salesforce _Data 360_의 데이터 수집 및 제로 복제 패턴을 비교하여 기능, 보상 및 이점, 엔터프라이즈 사용 사례 및 결과에 초점을 맞춥니다. 성능, 비용, 규정 준수에 균형을 맞추는 하이브리드 멀티 클라우드 데이터 플랫폼을 설계할 때 이를 참조할 수 있습니다.
| 패턴 유형 | 모드/도구 | 혜택 | 고려 사항 | 결과 |
|---|---|---|---|---|
| 데이터 수집 |
실시간:
|
|
|
Agentforce:
|
스트리밍:
|
|
|
Agentforce:
|
|
배치:
|
|
|
Agentforce:
|
|
| Zero Copy |
Live Query:
|
|
|
Agentforce:
|
고속 쿼리(캐싱):
|
|
|
Agentforce:
|
|
파일 통합:
|
|
|
Agentforce:
|
Data 360에는 데이터 수집, 데이터 통합 제로 복사, 하이브리드 접근 방식의 세 가지 기본 통합 패턴이 있습니다.
_데이터 수집_을 사용하면 데이터가 물리적으로 _Data 360_에 복사되어 완전히 관리되며, 데이터가 소스에 남아 있는 _Zero Copy_와는 다릅니다. 즉, 변환을 위한 계산은 중앙 집중식 관리 및 감사를 제공하는 Data 360 내에서 수행됩니다.
규정 준수 및 운영 제어를 위해 _데이터 수집_을 사용하여 Salesforce _Data 360_에 정규 관리 데이터 집합을 저장합니다. 전체 제어, 감사, 추적 가능성이 필요한 경우 수집을 사용합니다. 데이터 수집은 중앙 집중식 계산 및 거버넌스가 중요한 규제 또는 가치가 높은 워크플로에 적합합니다.
수집은 ID 확인, 규제 보고, 미션 크리티컬한 AI 기반 워크플로 및 고객 참여를 위한 신뢰할 수 있는 기반을 구축하는 데 적합합니다.
데이터 수집 방법은 데이터 수집에 사용하는 커넥터에 따라 다를 수 있습니다. 일부 커넥터는 다양한 수집 방법을 제공하며, 다른 커넥터는 배치 또는 스트리밍 모드에서만 작동합니다. Data 360 커넥터 및 사용 가능한 방법의 전체 목록을 보려면 Data 360: 통합 및 커넥터.
- 실시간:
- _Change Data Capture(CDC)_를 사용하여 초 단위 미만의 데이터 수집을 제공합니다.
- 시간이 중요한 워크플로에 적합합니다(예: 사기 감지, 개인 설정, 운영 대시보드).
- 다운스트림 I/O를 줄이고 컴퓨팅 사용을 최적화하는 데 도움이 되는 Data 360 내 푸시 변환 및 집계 기능
- 증분 CDC를 사용하여 데이터 섞기 최소화 지원
- 스트리밍:
- 1~3분마다 소규모 증분으로 데이터를 수집합니다.
- 신선함과 비용의 균형 유지
- 캠페인 오케스트레이션, 거의 실시간 참여, 운영 보고에 적합
- 마이크로 배치를 사용하여 입출력 급증 제어 지원
- 가능한 경우 소스에서 데이터를 집계하여 전송량을 줄이고 저장소를 최적화합니다.
- 배치(예약 로드):
- 대규모 데이터 집합의 정기 수집을 제공합니다(예: 시간별, 매일, 매주).
- 내역 데이터 집합, 규제 보고, 규정 준수 사용 사례에 대한 비용 효율성 및 신뢰성을 제공합니다.
- 성능을 향상하고 비용을 최적화하기 위해 계산 지역이 소스 저장소와 동일한 지역에 있는지 확인합니다.
- 데이터 수집 사용 사례:
- Customer 360 통합 프로필 생성. 고객 ID 및 특성에 대한 신뢰할 수 있는 단일 소스를 구축합니다.
- 규제 준수 데이터 집합을 유지합니다. 민감한 데이터에 대해 거버넌스, 계보 및 감사 가능성을 적용합니다.
- 캠페인 오케스트레이션을 중앙 집중화합니다. 마케팅, 세일즈, 서비스가 모두 일관되고 신뢰할 수 있는 데이터 집합에서 작동하는지 확인합니다.
- 설계 방법:
- 역사적 또는 저지연을 허용하는 요구 사항(예: 보관 보고서 또는 정기 스냅샷)에 대해 배치 수집을 수용합니다.
- CDC 또는 스트리밍 API를 사용하여 운영 및 개인화 워크플로를 최신 상태로 유지하여 실시간에 가까운 업데이트를 보장합니다.
- 전체 데이터 집합을 다시 로드하는 대신 비용 및 효율성을 최적화하기 위해 증분 로드를 적용하여 저장소 및 계산 성장을 제어합니다.
- 수집 파이프라인을 컴퓨팅 로컬리티 및 증분 처리에 맞춰 네트워크 I/O를 줄입니다.
- 불필요하게 원시 데이터를 이동하지 않도록 Data 360 내에서 변환을 적용합니다.
- 비용 고려 사항:
- 실시간 수집은 가장 높은 컴퓨팅 및 파이프라인 비용이 발생하며, 이는 개인화, 운영 대시보드 또는 Agentforce 기반 작업과 같이 가치가 높고 시간에 민감한 워크플로에 대해 정당화될 수 있습니다.
- 스트리밍 수집은 적당한 컴퓨팅 및 스토리지 비용이 소요되며, 약간의 지연을 감수할 수 있는 빈번한 업데이트(예: 캠페인 오케스트레이션 또는 운영 보고)에 적합할 수 있습니다.
- 배치 수집은 낮은 컴퓨팅 비용과 예측 가능한 스토리지를 제공하며, 이 스토리지는 기록 데이터 집합이나 저주량 업데이트에 적합합니다. 특정 커넥터를 사용하여 Salesforce 조직에서 배치 데이터를 수집하는 것은 무료입니다.
- 새로 고침 모드에서는 증분 새로 고침 모드를 선택할 수 있으며, 이를 통해 총 수집 및 계산 비용을 줄일 수 있습니다. Salesforce에서는 모든 수집 유형의 효율성을 최적화하기 위해 가능한 한 _증분 새로 고침_을 사용하는 것이 좋습니다.
- 비용도 소스에서 _Data 360_으로의 I/O 볼륨에 영향을 받습니다. 배치 크기, 파티션, 지역 정렬을 최적화하면 전송 비용이 절감되고 성능이 향상됩니다.
- 산업 시나리오:
- 금융: 수집 데이터 집합은 고객 파악(KYC), 돈 세탁 방지(AML) 및 감사 가능성 및 규정 준수가 협상되지 않는 사기 감지에 필요합니다.
- 헬스케어: 환자 신원 확인 및 HIPAA 준수를 충족하는 레코드를 위해 수집을 사용하면 안전하고 통합된 뷰를 제공할 수 있습니다.
- 소매: 세분화 및 개인 설정을 위해 Sales Point (POS), eCommerce 및 충성도 프로그램 데이터를 통합 프로파일로 통합합니다.
- Telecom: 표준화되고 관리되는 구독자 데이터로 이탈 방지 및 사용량 분석을 지원합니다.
| 기능 | 실시간 수집 | 스트리밍 수집 | 배치 수집 |
|---|---|---|---|
| 지연성과 신선함 | Change Data Capture (CDC) 지원을 통해, 1초 미만의 지연을 제공하는 수집 기능을 Ingestion API로 제공합니다. 연속 스트리밍 파이프라인을 제공합니다. 대기 시간이 낮은 운영 사용 사례에 적합합니다. | 네이티브 커넥터를 통해 1~3분마다 마이크로 배치 수집을 제공합니다. 증분 업데이트를 지원합니다. 약간의 대기 시간이 예상됩니다. | 데이터 대기 시간이 예상됩니다. 예약된 대용량 로드를 허용합니다. 정기 수집(시간별, 매일, 매주)을 제공합니다. 시간에 민감한 작업에는 적합하지 않습니다. |
| 기본 사용 사례 | 대기 시간이 낮은 운영 및 개인화 사용 사례에 적합합니다. 시간에 민감한 워크플로에 사용합니다. 이벤트 중심 워크플로를 지원합니다. 실시간 사기 경고 및 운영 경고에 사용합니다. | 적당히 긴급한 프로세스에 적합합니다. 캠페인 오케스트레이션, 실시간 참여, 운영 보고에 사용합니다. 적시에 캠페인 트리거에 사용합니다. | 대량 데이터 집합의 경우 비용 효율적입니다. 역사적 분석을 신뢰할 수 있습니다. 이력 집계 또는 규제된 보고 워크플로에 사용합니다. 이력 또는 저속 데이터 집합에 적합합니다. |
| 아키텍처 복잡성 및 I/O | 비용이 많이 들고 복잡한 아키텍처를 포함합니다. 저지연 소스 시스템이 필요합니다. 입출력 집약적입니다. 대용량 소스는 포화 파이프라인을 야기할 수 있습니다. | 실시간보다 더 간단한 아키텍처를 제공합니다. 입출력은 보통입니다. 예측 가능한 반복 업데이트 패턴에 적합합니다. 배치 크기는 메모리 및 계산에 영향을 미칩니다. | 구현하기 쉽습니다. 로드 기간 동안 I/O 집약적입니다. 네트워크 처리량은 대량 배치에서 병목 현상이 될 수 있습니다. |
| 비용 고려 사항 | 가장 높은 계산 및 파이프라인 비용을 포함합니다. 가치가 높고 시간에 민감한 워크플로에 대해서만 정당화될 수 있습니다. | 보통의 컴퓨팅 및 스토리지 비용을 포함합니다. 비용과 신선도 간 균형 잡힌 접근 방식을 제공합니다. 약간의 지연을 허용할 수 있는 자주 업데이트에 적합합니다. | 컴퓨팅 비용을 낮추고 예측 가능한 스토리지를 제공합니다. 이력 데이터 집합 또는 저빈도 업데이트에 권장됩니다. Salesforce 내부 파이프라인을 통한 수집은 무료입니다. |
| 설계 관행 | 증분 CDC를 사용하여 데이터 셔플링을 최소화합니다. 선택적 필드를 필터링하고 사용하여 오버헤드를 줄입니다. | 마이크로 배치를 사용하여 입출력 급증을 제어합니다. 처리 부하를 줄이기 위해 윈도우 집계를 고려합니다. | 보관 보고 또는 정기 스냅샷에 사용합니다. 비용 최적화를 위해 컴퓨팅 리소스의 위치가 소스 저장소와 동일한 지역에 있는지 확인합니다. |
_Zero Copy_를 사용하면 데이터 중복 없이 외부 시스템을 실시간으로 쿼리하여 대규모 또는 임시 데이터 집합에 대한 민첩성, 신선도 및 확장 가능한 액세스를 실현할 수 있습니다. 라이브 대시보드, 탐색적 분석, AI/ML 모델 학습, 그리고 실시간 고객 참여에 Salesforce _Data 360_을 통해 직접 사용할 수 있습니다.
_Zero Copy_를 사용할 때 아키텍트는 세 가지 사용 가능한 데이터 연합 방법 중에서 선택해야 하며, 각 방법은 신선도, 성능 및 비용 간의 고유한 트레이드오프를 제공합니다.
- Live Query
- 데이터 중복 없이 외부 시스템(예: Snowflake, Google BigQuery, Redshift, Databricks 등)에 대한 쿼리를 직접 실행합니다.
- 네트워크를 통한 데이터 이동을 최소화하고 Salesforce Data 360 계산의 I/O를 줄여, 조건자와 집계를 푸시다운할 수 있을 때 최적입니다.
- 실시간 인사이트 및 대기 시간이 낮은 운영 대시보드에 적합합니다.
- 외부 시스템 성능에 따라 다릅니다.
- 캐싱(고속 쿼리)
- Salesforce _Data 360_에 연합 데이터의 캐시된 복제본을 일시적으로 저장합니다.
- 구성 가능한 기간(분~일)으로 자주 액세스하는 데이터 집합에 대한 반복 쿼리 비용 및 대기 시간을 줄입니다.
- 데이터는 영구적으로 복사되거나 완전히 관리되지 않으므로 소스에서 예약된 새로 고침을 통해 최신 상태를 관리합니다.
- _증분 새로 고침_은 업서트만 지원합니다. 삭제된 레코드는 캐시에서 제거되지 않습니다.
- 캐시가 소스와 동기화된 상태로 유지되도록 정기적으로 전체 새로 고침을 수행합니다.
- 참고: Snowflake 커넥터는 Snowflake 시작 스테이징 버킷을 사용하여 가속 속도를 향상시키는 다운로드 기능을 지원합니다. 기본적으로 활성화되어 있지만 연결을 편집하여 비활성화할 수 있습니다.
- 파일 통합
- 객체 저장소(예: S3 및 _GCS_에서 _Iceberg_가 적용되는 경우)에서 대규모 데이터 집합에 대해 읽기 전용으로 직접 접근할 수 있습니다.
- 데이터를 이동하지 않고 AI/ML 워크로드, 이력 분석 및 페타바이트 규모의 보고에 적합합니다.
- 쿼리 성능은 개체 형식, 분할, 네트워크 I/O에 크게 의존합니다. 대규모 스캔은 최적화되지 않은 경우 상당한 I/O를 생성할 수 있습니다.
- 사용 사례
- 고객 행동이 변화함에 따라, 실시간 맞춤화 및 적응형 워크플로우는 동적 제안, 권장 사항 및 차기 최적의 행동을 제공합니다.
- 실시간 대시보드 및 운영 분석은 외부 창고에서 직접 비즈니스 크리티컬 대시보드 및 KPI를 제공합니다.
- 대규모 외부 데이터 세트를 사용하는 AI/ML 모델 교육은 파일 통합을 통해 이동하지 않고도 데이터 레이크 및 창고의 페타바이트 규모의 데이터를 활용합니다.
- 산업 시나리오
- 소매/미디어: 클릭스트림 또는 콘텐츠 상호 작용 데이터를 연합하여 맞춤형 권장 사항 및 실시간 고객 참여를 활성화합니다.
- 금융: 중요한 데이터를 복제하지 않고 외부 창고를 쿼리하여 사기 감지 및 위험 점수 매기기를 거의 실시간으로 실행합니다.
- Tech/Enterprise: 데이터 집합이 여러 시스템에 있는 경우 클라우드 간 보고, IT 서비스 대시보드, 운영 분석을 지원합니다.
- 설계 관행
- Live Query
- 신선도가 중요한 상황에서 높은 QPS(초당 쿼리)와 낮은 대기 시간의 쿼리에 사용합니다.
- 외부 시스템에 조건자와 집계를 푸시하여 네트워크상에서의 데이터 이동을 줄입니다.
- 불필요하게 대용량 데이터를 스캔하는 쿼리를 피하십시오.
- 대신 파티션 프루닝 및 필터를 고려하십시오.
- 파일 페더레이션
- 수집하지 않고 오브젝트 스토리지에서 페타바이트 규모의 데이터 집합에 액세스합니다.
- Salesforce 계산과 동일한 클라우드 리전에 오브젝트 스토리지를 유지하여 대기 시간 및 이그레스 비용을 최소화합니다.
- 파티셔닝된 컬럼 형식(Parquet/ORC) 및 푸시다운 필터를 사용하여 I/O 및 네트워크 전송을 줄입니다.
- 쿼리 및 조건자 푸시다운을 활용하여 소스에서 데이터를 필터링하고 집계하여 데이터 이동을 줄입니다.
- 절대적으로 필요한 경우를 제외하고 I/O, 대기 시간, 이그레스 비용이 증가하므로 리전 간 데이터 액세스를 피하십시오.
- 캐싱(고속 쿼리)
- 자주 액세스하는 데이터 집합을 캐시하여 비용과 성능의 균형을 맞춥니다.
- 새로 고침 간격을 구성하여 신선도와 쿼리 비용 간의 균형을 맞춥니다.
- 규정 준수: 소스에서 행 수준 보안(RLS) 및 마스킹 정책을 직접 연합 시스템 내에서 활용하여 거버넌스를 강화합니다.
- 다음은 플랫폼 전반에서 균일한 RLS 및 마스킹에 대한 몇 가지 모범 사례입니다.
- 중앙 집중식 엔터프라이즈 ID 사용. Salesforce _Data 360_의 사용자 및 엔티티를 외부 시스템의 ID에 해당하는 고유한 중앙 집중식 엔터프라이즈 식별자에 매핑합니다.
- 보안 정책 조정. 연합 시스템의 RLS 및 마스킹 정책이 매핑된 ID를 기반으로 적용되는지 확인합니다. 이렇게 하면 외부 데이터를 쿼리할 때 규정 준수를 유지할 수 있습니다.
- ID 스키마 표준화. 모든 데이터 소스에서 일관된 ID 특성(이메일, 사용자 ID, 고객 ID 등)을 유지하여 불일치 및 액세스 위반을 방지합니다.
- 다음은 플랫폼 전반에서 균일한 RLS 및 마스킹에 대한 몇 가지 모범 사례입니다.
- Live Query
- 비용 고려 사항
- Live Query: pay-per-query 모델에서 외부 레이크 하우스 계산에 비용이 누적되어 QPS가 높은 경우 급증할 수 있습니다. 이는 비용 변동성보다 높은 가치를 제공하는, 신선도가 중요한 사용 사례에 적합합니다.
- 고속 쿼리(캐싱): 이 방법은 소스 시스템에 대한 검색을 줄여 쿼리 비용(_실시간 쿼리)_을 낮추지만 캐시 채우기 및 새로 고침에 대한 배치 데이터 수집 비용을 추가합니다. 이는 자주 액세스하는 데이터 집합에 적합합니다.
- 파일 페더레이션: 오브젝트 스토리지에서 데이터로 저장하는 옵션은 가장 저렴하지만 쿼리 비용은 파일 크기, 파티셔닝, 프루닝에 따라 다릅니다. 이는 페타바이트 규모의 과거 또는 대량 데이터에 적합합니다.
| 결정 지점 | 라이브 쿼리 | 캐싱(가속 쿼리) | 파일 통합 |
|---|---|---|---|
| 데이터 소스 위치 | 외부 데이터 레이크(예: Snowflake, Google BigQuery, Redshift 및 Databricks) | 외부 데이터 레이크(예: Snowflake, Google BigQuery, Redshift 및 Databricks) | 오브젝트 저장소 또는 클라우드 데이터 레이크(예: S3, ADLS 및 GCS)는 종종 _Iceberg_와 같은 오픈 테이블 형식을 사용합니다. |
| 용도/사용 사례 | 대화형 분석 및 실시간 대시보드에 적합합니다. 실시간 개인화 및 동적 워크플로에 적합합니다. | 쿼리가 자주 이루어지지만 결과가 약간 오래된 경우에 적합합니다. BI 대시보드 및 세분화에 적합합니다. | 대규모 배치 처리 및 AI/ML 모델 훈련에 적합합니다. 과거 분석 및 페타바이트 규모 보고에 적합합니다. |
| 신선도/대기 시간 | 최대의 신선도를 제공하며, 실시간으로 쿼리를 실행합니다. 소스 시스템이 효과적인 조건자 푸시다운을 통해 대기 시간이 낮은 쿼리에 최적화된 경우, 1초 미만의 빠른 의사결정을 지원합니다. | 약간 오래된 결과가 허용되는 경우 사용합니다. 새로 고침은 15분에서 7일 사이에 구성할 수 있는 캐시 간격에 따라 다릅니다. | 처리량이 많은 배치 작업에 적합합니다. 실시간 대시보딩에 적합하지 않습니다. |
| 액세스 패턴 | 신선도가 중요한, 쿼리 빈도가 낮은 드문 또는 임시 쿼리에 적합합니다. QPS가 높은 경우 비용이 크게 증가하므로 쿼리 빈도가 높은 경우 캐싱(가속 쿼리)을 평가하는 것이 중요합니다. | 높은 빈도 읽기 시나리오에 적합합니다. 빈번한 액세스 패턴에 대한 성능을 개선합니다. | read-only 액세스를 제공합니다. 수집하지 않는 페타바이트 규모의 데이터 집합에 적합합니다. |
| 성능 드라이버 | 외부 소스 시스템 성능에 크게 의존합니다. 조건자 및 집계를 소스로 푸시할 수 있는 경우에 적합합니다. | 반복 실시간 쿼리와 비교하여 대기 시간을 줄입니다. 성능은 캐시 관리 및 간격에 따라 다릅니다. | 성능은 개체 형식, 파티션 분할 및 외부 시스템 처리량에 크게 의존합니다. 분할된 열 형식(Parquet/ORC)을 사용합니다. |
| 비용 영향 | 이 모델은 쿼리당 결제 모델이므로 외부 레이크 하우스 계산에 비용이 부과됩니다. 드문 쿼리에는 비용 효율적이지만 QPS 용량이 많은 경우 비용이 급증할 수 있습니다. | 비용은 반복 실시간 쿼리보다 낮습니다. 외부 소스를 반복적으로 쿼리할 필요가 없지만 캐시 저장소와 새로 고침 오버헤드가 추가됩니다. | 가장 저렴한 저장소 옵션입니다. 동일한 지역의 동일한 클라우드 AWS 설정(예: US-East-1의 S3 및 US-East-1에 있는 Data Cloud 테넌트)의 경우 액세스되는 행에 대한 크레딧이 사용되지 않습니다. 지역 간 또는 클라우드 간 구성(예: Azure, GCS 또는 다른 AWS 지역)은 액세스되는 행에 대한 크레딧 소비를 야기합니다. 쿼리 비용은 파일 크기, 파티션 분할 및 조건자 푸시다운 최적화에 따라 다릅니다. |
| 핵심 고려 사항 | 불필요하게 대량의 데이터를 스캔하는 필터링되지 않은 쿼리를 피하십시오. | 이 접근 방식은 캐시 관리를 필요로 합니다. 1초 미만의 빠른 의사결정에는 적합하지 않습니다. | 쿼리 성능은 파티셔닝 및 조건자 푸시다운을 통한 최적화에 크게 의존합니다. |
하이브리드 아키텍처를 사용하면 설계자가 중앙 집중식 거버넌스를 위해 중요한 데이터 집합을 _Data 360_에 배치하면서 신선도 유지, 중복 감소 및 대규모 외부 데이터 집합에 대한 확장 가능한 접근을 달성할 수 있습니다. 이 접근 방식은 I/O, 컴퓨트 로컬리티, 비용, 규정 준수 요구 사항의 균형을 맞춥니다.
데이터 수집 및 제로 복사를 결합하여 실시간 실행 가능한 인사이트를 제공하여 균형 잡힌 거버넌스, 신선함, 운영 효율성을 위해 하이브리드 접근 방식을 사용합니다. 추적 가능성, RLS, 마스킹이 필요한 규제된 가치가 높은 데이터 집합에 대한 수집을 사용하고, 신속성 및 성능이 중요한 임시 또는 대용량 데이터 집합에 대한 연합을 사용합니다.
- 사용 사례
- 옴니채널 고객 참여: 과거 고객 데이터를 실시간 행동과 결합하여 상황에 맞는 일관된 환경을 제공합니다.
- AI/ML 파이프라인: 선별된 표준 데이터 집합에서 모델을 학습시키고, 외부 소스의 원시 또는 실시간 신호로 보강합니다.
- 복합적인 규정 준수 및 민첩성 요구 사항: 민감한 데이터에 엄격한 거버넌스를 적용하고, 운영 민첩성을 위해 연합을 적용합니다.
- 산업 시나리오
- 소매: ID 확인 및 프로필 통합을 위해 _ingestion_을 사용하고, 실시간 제안 및 개인화를 위해 _federation_을 사용합니다.
- 헬스케어: _수집_을 통해 환자 기록을 유지하면서, 즉각적인 컨텍스트를 위해 IoT 장치 스트림 및 센서 데이터에 연합을 적용합니다.
- 금융 서비스: 규제된 데이터를 규정 준수에 의해 관리되는 데이터 레이크에 수집하고, 외부 사기 감지 및 위험 모니터링 쿼리를 위해 연합을 사용합니다.
- 설계 관행
- 수집을 통한 앵커 거버넌스: 높은 가치 또는 규제된 데이터를 표준 모델로 수집하여 신뢰와 규정 준수를 보장합니다.
- 신선도 유지를 위한 연합 사용: 외부 레이크 하우스에서 중복 없이 실시간 또는 대규모 데이터 액세스를 제공할 수 있습니다.
- 비용 대비 성능: 작업 부하를 프로파일링하여 수집 또는 _연합_을 언제 사용할지 결정하여 불필요한 스토리지 및 쿼리 비용을 최소화합니다.
- 계층형 거버넌스 적용: 수집된 데이터에 중앙 집중식 거버넌스를 적용하면서, 연합 시스템의 보안 제어(예: RLS 및 마스킹)를 활용합니다.
- 참고: 하이브리드 파이프라인을 설계할 때 역사적 데이터 집합을 증분적으로 수집하고 연합 소스에 집계 또는 필터를 푸시하여 입출력 및 계산 사용을 최적화하는 것이 중요합니다.
- 비용 고려 사항
- 규정 준수나 중요한 데이터의 경우에는 _수집_을, 신선도가 요구되는 경우에는 _연합_을 결합하여 총 비용과 성능을 평가합니다.
- _수집_과 _연합_을 혼합할 때 I/O 및 계산 분포를 고려합니다. 소스 시스템에 대한 반복 쿼리의 계산 비용을 줄이려면 읽기 빈도가 높고 자주 액세스하는 연합 데이터 집합에 캐싱(Accelerated Query)을 사용합니다.
- 이 규칙을 사용하여 수집과 연합 중 무엇을 선택할지 결정하세요. 데이터가 자주 액세스되지만 자주 변경되지 않는 경우 일반적으로 _Accelerated Query_가 더 비용 효율적입니다. 그러나 데이터가 자주 변경되는 경우(액세스 빈도와 관련하여) 실시간 쿼리 또는 _복사_가 더 적합합니다. 다음은 몇 가지 비용 예시입니다.
- 가속화가 유리한 경우: 100만 개의 레코드로 구성되고 매일 약 1만 건이 변경되어 업데이트되는 대시보드는 하루에 20회 조회됩니다. 가속화 비용은 약 600 크레딧/월이며, _Live Queries_의 경우 약 4,200 크레딧/월입니다.
- Live Query가 유리한 경우: 30분마다 변경되는 데이터를 사용하여 하루에 20번 게시되는 세그먼트입니다. Live Queries 비용은 이 새로 고침 주기에서 약 4,200 크레딧/월이며, _가속화_의 경우 약 28,800 크레딧/월입니다.
이 논리를 적용하는 방법을 설명하는 몇 가지 일반적인 아키타입을 자세히 살펴보겠습니다.
- “단일 진실의 원천” 아키타입: 중앙 집중화 및 거버넌스
- 시나리오: 전체 글로벌 기업에 대해 규정 준수 및 통합된 Customer 360 프로필을 작성해야 합니다. 데이터는 수십 개의 다른 시스템에서 제공되며, 엄격한 GDPR 및 CCPA 규정을 준수해야 하며 모든 마케팅 및 서비스 상호 작용에 대한 진실의 원천이 될 것입니다.
- 권장 패턴: 데이터 수집. 여기서 우선 순위는 거버넌스, 신뢰 및 통제입니다. 데이터를 _Data 360_에 수집하면 소스 시스템과 분리된 완전히 감사 가능한 정규 프로필을 만들 수 있습니다.
- “실시간 인사이트” 아키타입: 이동하지 않고 분석
- 시나리오: 데이터 과학 팀은 _Snowflake_의 거대한 트랜잭션 테이블에서 탐색적 쿼리를 실행해야 합니다. 동시에 경영진 팀은 동일한 데이터로 구동되는 실시간 BI 대시보드를 원합니다. 매일 페타바이트의 데이터를 이동하는 작업은 느리고 비싸습니다.
- 권장 패턴: Zero Copy Federation. 우선 순위는 속도, 민첩성, 대규모 환경에서의 비용 효율성입니다. Zero Copy를 사용하면 데이터 중복의 오버헤드와 지연 없이 기존 데이터 웨어하우스의 잠재력을 실시간 쿼리에 활용할 수 있습니다.
- “하이브리드 인텔리전스” 아키타입: 핵심에 거버넌스를 적용하고, 엣지를 연합합니다.
- 시나리오: 데이터 레이크에서 실시간 동작 신호(예: 웹 사이트 클릭)를 사용하여 관리 및 수집된 고객 프로필을 보강하려는 경우 핵심 프로필의 안정성과 실시간 데이터의 즉시성이 모두 필요합니다. 즉각적인 개인화를 실현하려면 두 요소가 모두 중요합니다.
- 권장 패턴: 하이브리드 접근법. _데이터 수집_을 사용하여 고객 데이터에 대한 안정적이고 거버넌스가 적용된 핵심을 만듭니다. _Zero Copy_를 사용하여 변동성이 큰 실시간 “엣지” 데이터를 연합한 다음, 쿼리 시점에 결합하여 완전하고 최신의 보기를 제공합니다.
엔터프라이즈 데이터 전략은 더 이상 단일 통합 패턴 선택에 중점을 두지 않으며, 상호 운용 가능한 데이터 에코시스템 내에서 제어된 유연성을 설계하는 것입니다. 올바른 접근 방식은 각 소스 시스템을 최신성, 거버넌스, 비용, 액세스 요구 사항에 가장 적합한 패턴으로 매핑합니다.
- 규제된 미션 크리티컬 데이터 집합을 Salesforce _Data Cloud_에 수집하여 규정 준수, ID 확인 및 운영 워크플로를 수행합니다.
- 스토리지 중복 없이 실시간, 탐색적, AI 기반 분석을 위해 _Zero Copy_를 통해 데이터를 연합합니다.
- 쿼리 빈도가 높고 데이터 변경 빈도가 낮을 경우 소스 시스템 로드 및 크레딧 소비를 줄이기 위해 캐싱(Accelerated Query) 적용
Salesforce Data 360 on _Hyperforce_는 다중 지역의 복원력과 확장성을 제공합니다. Iceberg 테이블을 갖춘 개방형 호수 하우스는 Snowflake, Databricks 및 S3 Iceberg와 같은 플랫폼과 컴퓨팅 분리 및 상호 운용성을 가능하게 하며, 이는 진정으로 상호 운용 가능한 멀티 클라우드 데이터 에코시스템의 기둥입니다.
데이터 생태계가 발전함에 따라 아키텍처의 민첩성을 유지하려면 신선성, 비용, 성능, 규정 준수의 균형을 지속적으로 맞춰야 합니다. 그래서 수집되고 관리된 데이터를 연합 액세스와 통합하여 플랫폼을 미래에도 대비할 수 있도록 하는 것이 중요합니다. 이를 통해 클라우드, 지역, 비즈니스 도메인 전반에서 실시간 인텔리전스, AI 활성화, 엔터프라이즈 규모의 개인화가 가능합니다.
모든 규모를 충족하는 솔루션은 대부분의 비즈니스에 적합하지 않습니다. 최적의 전략은 올바른 패턴을 올바른 비즈니스 동인에 매핑합니다.
Yugandhar Bora는 데이터 및 인텔리전스 애플리케이션 플랫폼 내의 데이터 아키텍처를 전문으로 하는 Salesforce의 소프트웨어 엔지니어링 아키텍트입니다. 그는 데이터 거버넌스 및 통합 데이터 모델에 초점을 맞춘 엔터프라이즈 아키텍처 검토 위원회(EARB) 이니셔티브를 이끌고 있으며, 자동화된 플랫폼 프로비저닝 솔루션에도 기여합니다.
Jan Fernando는 2012년 Salesforce에 합류한 Salesforce의 _최고 아키텍트 사무실(OCA)_의 수석 아키텍트입니다. 그는 스타트업 생태계에서의 풍부한 경험을 가지고 있습니다. OCA에 합류하기 전에 그는 플랫폼 조직에서 10년 이상 근무했으며, 여기에서 몇 가지 핵심 기술 전환을 이끌었습니다.