Interoperabilidad de Data 360

Las empresas a menudo almacenan datos en Salesforce y otros lagos de datos externos (por ejemplo, Snowflake, Google BigQuery, Databricks, Redshift o almacenamiento de objetos como Amazon S3). El aislamiento de datos entre múltiples sistemas crea un reto para las empresas que desean aprovechar el valor completo de sus datos para potenciar experiencias dirigidas por la IA. Salesforce Data 360 es la capa de inteligencia fundamental que cada agente de IA Agentforce utiliza para acceder al contexto correcto en el momento correcto.

Los arquitectos que trabajan para reunir datos entre múltiples lagos de datos se enfrentan a decisiones arquitectónicas clave sobre cómo integrar mejor esos datos. Data 360 proporciona múltiples opciones para la integración de datos, cada una ofreciendo varios pros y contras.

Esta guía proporciona un marco de trabajo para evaluar qué patrón se ajusta mejor a sus requisitos de latencia, coste, escalabilidad, regulación y complejidad al integrar datos, ayudándole a elegir cuándo utilizar la introducción de datos, la federación de datos de copia cero o un enfoque híbrido. La guía también le ayudará a seleccionar entre diferentes métodos de introducción de datos y federación de datos, cada uno de los cuales satisface una necesidad diferente.

La integración de casas de lago de datos externas con Data 360 requiere considerar cuidadosamente las ventajas entre la actualización de datos, la gobernanza y la eficiencia de las oportunidades en curso. Por ejemplo, el uso de consultas en vivo de federación de datos de copia cero maximiza la actualización de los datos, pero puede reducir la eficiencia de las oportunidades en curso a medida que más datos se mueven por la red. Para la mayoría de las implementaciones del mundo real, la combinación de introducción y federación en un ecosistema de casas de lago de múltiples nubes es la ruta óptima. Este enfoque híbrido garantiza una arquitectura ampliable, gobernada e interoperable que admite cargas de trabajo operativas de baja latencia (por ejemplo, personalización en tiempo real y detección de fraude) y cargas de trabajo analíticas (por ejemplo, creación de informes normativos y análisis de tendencias históricas). Esta guía le ayuda a determinar cómo navegar por estas compensaciones utilizando una estrategia apropiada.

  • Ingestión de datos copia datos en Salesforce Data 360 y crea modelos de datos gobernados y canónicos. Esto es ideal para cuando necesita:
    • Cree un Customer 360 integral. Esto le permite unificar y transformar orígenes dispares en un perfil único y de confianza.
    • Cumplir con el estricto cumplimiento normativo. Esto le permite crear una copia auditable y centralizada de modo que el acceso a los datos y el linaje puedan controlarse estrechamente.
  • Zero Copy Federation consulta fuentes externas en tiempo real sin duplicación, lo que permite la personalización en tiempo real, paneles en vivo e incorporación rápida de fuentes. Este enfoque proporciona dos opciones principales, pero hay compensaciones que deben equilibrarse:
    • Consulta en vivo: Utilice esto para análisis interactivos y paneles de datos en tiempo real que viven en plataformas de datos externas (por ejemplo, Snowflake, BigQuery, Redshift o Databricks). Esto ayuda a evitar la duplicación de datos lenta y costosa enviando el procesamiento de consultas al sistema de origen y devolviendo solo resultados necesarios. Este enfoque está optimizado para consultas poco frecuentes o ad hoc donde la actualización es crítica. Es adecuado para cargas de trabajo de consulta por segundo bajas (los costes de consulta pueden aumentar significativamente a QPS alto).
    • Almacenamiento en caché (Consulta acelerada): Utilice esto para consultas de datos frecuentes que no cambian a menudo. Las consultas aceleradas mantienen una caché local que se actualiza a intervalos configurables (15 minutos a 7 días), lo que reduce las repeticiones de coincidencias de origen. Este enfoque equilibra el rendimiento y el coste del panel, la segmentación y las cargas de trabajo de BI donde los resultados ligeramente obsoletos son aceptables. Esto no es adecuado para la toma de decisiones de subsegundos.
    • Federación de archivos: Utilice esto para el procesamiento por lotes a gran escala y el entrenamiento de modelo de IA para datos en el lago de datos de su nube (por ejemplo, S3 o ADLS). Este enfoque evita la introducción lenta y costosa consultando directamente archivos en formatos de tabla abiertos, lo que desbloquea conjuntos de datos ETL masivos y cargas de trabajo de ciencia de datos.
  • Los modelos híbridos combinan la introducción para perfiles unificados con la federación para la actualización, que admite la implicación de OmniCanal, acciones dirigidas por Agentforce y entrenamiento de IA/ML.
  • Emplear una arquitectura híbrida. A menudo es necesario mezclar la introducción y federación de datos.
    • Utilice Ingreso de datos en datos críticos para modelos de datos canónicos y regulación principal.
    • Utilice Copia cero para el resto de federaciones de datos para mantener la actualización y minimizar los gastos operativos de creación y mantenimiento de oportunidades en curso de introducción de datos.
  • La frecuencia de introducción de datos importa. Seleccione la frecuencia basándose en el valor comercial, las necesidades de latencia y la complejidad operativa.
    • Utilice el tiempo real para flujos de trabajo que distinguen entre el tiempo (por ejemplo, personalización, paneles en vivo y acciones Agentforce).
    • Utilice Casi en tiempo real para procesos de urgencia moderada (por ejemplo, campañas e informes operativos).
    • Utilice lotes para conjuntos de datos históricos o de baja velocidad.
  • Haga coincidir los patrones de federación con la latencia y el rendimiento. Seleccione la opción que mejor coincida con sus patrones de acceso y requisitos de actualización, rendimiento y coste.
    • Utilice Live Query para paneles operativos y personalización en tiempo real donde la baja latencia es crítica.
    • Utilice el almacenamiento en caché (Consulta acelerada) cuando las consultas son frecuentes y los resultados ligeramente obsoletos son aceptables, lo que ayuda a equilibrar el rendimiento y el coste.
    • Utilice Federación de archivos para análisis a gran escala y con gran rendimiento o cargas de trabajo por lotes, que son ideales para conjuntos de datos históricos o con menos retraso.
  • Alinear la gobernanza con los requisitos de residencia de datos.
    • Utilice la introducción cuando la gobernanza centralizada sea crítica.
    • Utilice la federación cuando la gobernanza descentralizada sea aceptable, al tiempo que aplica una gobernanza estricta en la fuente externa.
    • Utilice Copia cero con respecto a políticas a nivel de origen (por ejemplo, seguridad a nivel de filas y enmascaramiento de datos).
  • Priorice la introducción para flujos de trabajo de alto valor. Aplique la introducción de forma selectiva a procesos críticos (por ejemplo, resolución de identidad, creación de informes normativos y activación operativa).
  • Coste y complejidad dirigen las decisiones. La ingesta en tiempo real puede ser costosa y compleja. Por eso es importante que los arquitectos ponderen el coste de incorporar, almacenar y transformar datos con el coste de consultarlos directamente a través de Copia cero.

La selección del patrón de integración correcto (Ingestión de datos, Copia cero o un enfoque híbrido) afecta directamente a la latencia, la gobernanza, la eficiencia operativa y el coste entre plataformas de múltiples nubes. Esta decisión determina cómo se entregan perspectivas en tiempo real, activación dirigida por IA e implicación personalizada de forma fiable y a escala.

Esta tabla compara los patrones de Ingreso de datos y Copia cero en Salesforce Data 360, centrándose en funciones, compensaciones y beneficios, así como casos de uso y resultados empresariales. Utilice esto como referencia para diseñar plataformas de datos híbridas de múltiples nubes que equilibren el rendimiento, el coste y el cumplimiento.

Tipo de patrón Modo/herramienta Beneficios Consideraciones Resultados
Ingestión de datos En tiempo real:
  • Ingestión de latencia de subsegundos a través de API de introducción con compatibilidad de CDC.
  • Canalizaciones de transmisión continua.
  • Proporciona perspectivas inmediatas
  • Abarca casos de uso operativos y de personalización de baja latencia
  • Admite flujos de trabajo dirigidos por eventos
  • Alto coste
  • Arquitectura compleja
  • Requisitos del sistema de origen de baja latencia
  • Las fuentes de gran volumen pueden causar una transmisión excesiva, lo que conduce a oportunidades en curso saturadas
  • intensivo de E/S
  • Los campos selectivos y el filtrado pueden ayudar a reducir los gastos generales
Agentforce:
  • Alertas de fraude en tiempo real, personalización minorista y alertas operativas
Analytics:
  • Paneles de subsegundos y supervisión de KPI
Cumplimiento:
  • Actualizaciones continuas de registros de clientes para flujos de trabajo regulados
Transmisión:
  • Ingestión de microlotes cada 1-3 minutos a través de conectores nativos
  • Equilibra el coste frente a la frescura
  • Cuenta con una arquitectura más sencilla que en tiempo real
  • Admite actualizaciones incrementales
  • Leve latencia
  • Puede no ser adecuado para decisiones críticas de subsegundos
  • El tamaño de lote afecta a la memoria/el cálculo
  • E/S moderada
  • Adecuado para patrones de actualización predecibles y repetitivos
  • La agregación con ventanas puede ayudar a reducir la carga de procesamiento
Agentforce:
  • Desencadenadores de campaña oportunos y participación casi en vivo
Analytics:
  • Motores de recomendación y paneles casi en vivo
Cumplimiento:
  • Actualizaciones frecuentes con capacidad de auditoría
Lote:
  • Proporciona cargas de gran volumen programadas a través de conectores o API.
  • Admite almacenamiento de objetos y oportunidades en curso de ETL/ELT.
  • Admite rentabilidad para conjuntos de datos masivos
  • Cuenta con una implementación sencilla
  • Proporciona fiabilidad para análisis históricos
  • Latencia de datos
  • Inadecuado para operaciones sensibles al tiempo
  • intensivo de E/S durante ventanas de carga
  • El rendimiento de red puede convertirse en un cuello de botella para archivos de gran tamaño
  • Adecuado para flujos de trabajo de agregación histórica o creación de informes regulados
Agentforce:
  • Tickets de asistencia de TI (Jira/ServiceNow) y flujos de trabajo agregados
Analytics:
  • Análisis histórico y evaluación de tendencias
Cumplimiento:
  • Creación de informes normativos y agregación de datos de pacientes/reclamaciones
Zero Copy Consulta en vivo:
  • Proporciona consultas directas en sistemas externos y esquemas en lectura sin duplicación de datos
  • Proporciona la máxima frescura
  • Cuenta con un gasto de almacenamiento mínimo
  • Admite perspectivas operativas en tiempo real
  • Dependiendo del rendimiento de origen
  • Un alto volumen de consultas puede afectar a la latencia
  • Adecuado para consultas con agregación y distribución de predicados para minimizar las E/S
  • Evite utilizar consultas sin filtrar en conjuntos de datos masivos
Agentforce:
  • Flujos de trabajo dinámicos que se adaptan a la actividad en vivo
Analytics:
  • Paneles operativos y creación de informes en vivo
Cumplimiento:
  • Respeta la seguridad a nivel de filas y el enmascaramiento en el origen
Consulta acelerada (almacenamiento en caché):
  • Proporciona copias locales en caché para consultas federadas que son configurables de 15 minutos a 7 días.
  • Proporciona una ejecución de consultas optimizada
  • Reduce la latencia
  • Cuenta con costes más bajos que las consultas en vivo repetitivas
  • Mejora el rendimiento para patrones de acceso frecuentes
  • Gestión de caché requerida
  • La obsolescencia depende de los intervalos de caché
  • Adecuado para consultas de alta frecuencia
  • No es adecuado para la decisión de subsegundos
  • La actualización incremental solo admite alteraciones; los registros eliminados no se eliminan de la memoria caché.
  • Requiere periódicamente una actualización manual completa para mantener la memoria caché sincronizada con el origen
Agentforce:
  • Mediciones de implicación preagregadas para una decisión rápida
Analytics:
  • Paneles de BI, segmentación y creación de informes analíticos
Cumplimiento:
  • Paneles regulados de forma coherente con registros de auditoría
Federación de archivos:
  • Proporciona acceso directo a grandes conjuntos de datos históricos en establecimientos de objetos o lagos (por ejemplo, S3, Iceberg, Google BigQuery y Redshift).
  • Procesa conjuntos de datos a gran escala
  • Requiere almacenamiento mínimo en Data 360
  • Admite cargas de trabajo de IA/ML
  • Solo lectura
  • El rendimiento de las consultas depende del rendimiento del sistema externo
  • Adecuado para trabajos intensivos en lotes
  • No apto para paneles en tiempo real
Agentforce:
  • No es típico (cargado por lotes)
Analytics:
  • Entrenamiento de ML/IA, análisis histórico y creación de informes a escala de petabytes
Cumplimiento:
  • Gobierna el acceso a conjuntos de datos externos sin duplicación

Existen tres patrones de integración principales para Data 360: introducción de datos, federación de datos de copia cero y un enfoque híbrido.

Con Ingestión de datos, los datos se copian físicamente en Data 360 y se rigen completamente, a diferencia de Copia cero donde los datos permanecen en el origen. En otras palabras, el cálculo para transformaciones se produce dentro de Data 360, que proporciona una gobernanza y auditoría centralizadas.

Utilice Ingestión de datos para almacenar conjuntos de datos canónicos gobernados en Salesforce Data 360 para el cumplimiento y el control operativo. Utilice la introducción cuando se requiera control completo, auditoría y trazabilidad. La introducción de datos es ideal para flujos de trabajo regulados o de alto valor donde la computación centralizada y la gobernanza son fundamentales.

La introducción es adecuada para crear una base de confianza para la resolución de identidad, la creación de informes reguladores y flujos de trabajo dirigidos por IA de misión crítica y la implicación de clientes.

Descripción general de introducción de datos

Los métodos de ingesta de datos pueden variar, dependiendo del conector que utilice para introducir sus datos. Algunos conectores ofrecen una variedad de métodos de introducción, mientras que otros solo funcionan en modo de lotes o transmisión. Para obtener una lista completa de conectores de Data 360 y métodos disponibles, consulte Data 360: Integraciones y conectores.

  • En tiempo real:
    • Proporciona una ingesta de subsegundos utilizando Captura de datos (CDC)
    • Adecuado para flujos de trabajo que detectan el tiempo (por ejemplo, detección de fraude, personalización y paneles operativos)
    • Cuenta con transformaciones distribuidas y agregaciones dentro de Data 360, lo que ayuda a reducir las E/S descendentes y optimizar el uso informático
    • Admite el uso de CDC incremental para minimizar la combinación de datos
  • Transmisión:
    • Proporciona ingesta cada 1-3 minutos en pequeños incrementos
    • Equilibra la frescura y el coste
    • Adecuado para orquestación de campañas, implicación casi en vivo y creación de informes operativos
    • Admite el uso de microlotes para controlar picos de E/S
    • Agrega datos en el origen (si es posible) para reducir volúmenes de transferencia y optimizar el almacenamiento
  • Lote (Cargas programadas):
    • Proporciona la introducción periódica de grandes conjuntos de datos (por ejemplo, cada hora, diariamente y semanalmente)
    • Proporciona rentabilidad y fiabilidad para conjuntos de datos históricos, informes normativos y casos de uso de cumplimiento
    • Garantiza que la localidad de cálculo está en la misma región que el almacenamiento de origen para mejorar el rendimiento y optimizar los costes
  • Casos de uso de introducción de datos:
    • Generar perfiles unificados Customer 360. Cree una única fuente de verdad para identidades y atributos de clientes.
    • Mantenga conjuntos de datos de cumplimiento normativo. Aplique la regulación, el linaje y la capacidad de auditoría para datos confidenciales.
    • Centralice la orquestación de campañas. Asegúrese de que marketing, ventas y servicio funcionan desde conjuntos de datos coherentes y de confianza.
  • Prácticas de diseño:
    • Acomode la ingesta por lotes para necesidades históricas o tolerantes a baja latencia (por ejemplo, creación de informes de archivo o instantáneas periódicas).
    • Utilice las API de transmisión o CDC para mantener la actualización para flujos de trabajo operativos y de personalización para garantizar actualizaciones casi en tiempo real.
    • Controle el almacenamiento y calcule el crecimiento aplicando cargas incrementales para optimizar el coste y la eficiencia (en vez de volver a cargar conjuntos de datos completos).
    • Alinee las oportunidades en curso de introducción con la localización de cálculo y el procesamiento incremental para reducir la E/S de red.
    • Aplique transformaciones dentro de Data 360 para evitar mover datos sin procesar innecesariamente.
  • Consideraciones de costes:
    • La introducción en tiempo real tiene los costes de cómputo y oportunidades en curso más altos, lo que puede justificarse para flujos de trabajo de alto valor y urgentes (por ejemplo, personalización, paneles operativos o acciones dirigidas por Agentforce).
    • La introducción de transmisiones tiene costes de computación y almacenamiento moderados, lo que puede ser adecuado para actualizaciones frecuentes que pueden tolerar ligeros retrasos (por ejemplo, orquestación de campañas o creación de informes operativos).
    • La ingesta por lotes tiene costes de computación más bajos y almacenamiento predecible, lo que es adecuado para conjuntos de datos históricos o actualizaciones de baja frecuencia. Introducir datos por lotes desde organizaciones de Salesforce utilizando ciertos conectores es gratuito.
    • Modo de actualización Le permite seleccionar el modo de actualización incremental, que reduce la introducción total y calcula los costes. En Salesforce, recomendamos utilizar actualización incremental siempre que sea posible para optimizar la eficiencia en todos los tipos de ingesta.
    • El coste también se ve afectado por el volumen de E/S desde el origen a Data 360. La optimización de tamaños de lote, particiones y alineación regional reduce los costes de transferencia y mejora el rendimiento.
  • Escenarios industriales:
    • Finanzas: Los conjuntos de datos de introducción son necesarios para conocer a su cliente (KYC), antiblanqueo de dinero y detección de fraude donde la capacidad de auditoría y el cumplimiento no son negociables.
    • Asistencia sanitaria: Utilice la introducción para la resolución de identidad de pacientes y registros que cumplen con HIPAA, lo que permite vistas seguras y unificadas.
    • Retail: Consolide datos de puntos de venta, comercio electrónico y programas de fidelidad en perfiles unificados para segmentación y personalización.
    • Telecom: Compatibilidad con análisis de prevención de abandonos y uso con datos de suscriptor gobernados canónicos.
FunciónIngestión en tiempo realIngestión de transmisiónIngestión por lotes
Latencia y frescuraCuenta con ingesta de latencia por debajo del segundo a través de API de introducción con compatibilidad de Captura de datos. Proporciona oportunidades en curso de transmisión continua. Adecuado para casos de uso operativos de baja latencia.Incluye la introducción de microlotes cada 1 a 3 minutos a través de conectores nativos. Admite actualizaciones incrementales. Se espera una ligera latencia.Se espera latencia de datos. Permite cargas de gran volumen programadas. Cuenta con ingesta periódica (por hora, diariamente y semanalmente). No es adecuado para operaciones sensibles al tiempo.
Casos de uso principalesIdeal para casos de uso operativos y de personalización de baja latencia. Utilizar para flujos de trabajo sensibles al tiempo. Admite flujos de trabajo dirigidos por eventos. Utilizar para alertas de fraude en tiempo real y alertas operativas.Adecuado para procesos moderadamente urgentes. Utilizar para orquestación de campañas, implicación casi en vivo y creación de informes operativos. Utilizar para desencadenadores de campaña oportunos.Rentable para conjuntos de datos masivos. Fiable para análisis históricos. Utilizar para flujos de trabajo de agregación histórica o creación de informes regulados. Adecuado para conjuntos de datos históricos o de baja velocidad.
Complejidad arquitectónica y E/SIncluye arquitectura compleja y de alto coste. Requiere sistemas de origen de baja latencia. E/S intensiva. Los orígenes de gran volumen pueden causar oportunidades en curso saturadas.Cuenta con una arquitectura más sencilla que en tiempo real. La E/S es moderada. Adecuado para patrones de actualización predecibles y repetidos. El tamaño de lote afecta a la memoria y el cálculo.Fácil de implementar. Intensivo de E/S durante los plazos de carga. El rendimiento de red puede convertirse en un cuello de botella para lotes grandes.
Consideraciones de costesIncluye los costes de computación y oportunidades en curso más altos. Justificable solo para flujos de trabajo de alto valor y sensibles al tiempo.Incluye costes de computación y almacenamiento moderados. Proporciona un enfoque de coste equilibrado frente a frescura. Adecuado para actualizaciones frecuentes que pueden tolerar ligeros retrasos.Cuenta con costes informáticos más bajos y almacenamiento predecible. Recomendado para conjuntos de datos históricos o actualizaciones de baja frecuencia. La introducción a través de oportunidades en curso internas de Salesforce es gratuita.
Prácticas de diseñoUtilice CDC incremental para minimizar la combinación de datos. Filtre y utilice campos selectivos para reducir los gastos generales.Utilice microlotes para controlar picos de E/S. Considere la agregación con ventanas para reducir la carga de procesamiento.Utilizar para creación de informes de archivo o instantáneas periódicas. Asegúrese de que la localidad de cálculo está en la misma región que el almacenamiento de origen para la optimización de costes.

Utilice Copia cero para la consulta en tiempo real de sistemas externos sin duplicación de datos para permitir agilidad, actualización y acceso ampliable a conjuntos de datos grandes o transitorios. Es adecuado para paneles en vivo, análisis exploratorios, entrenamiento de modelos de IA/ML e implicación de clientes en tiempo real directamente a través de Salesforce Data 360.

Descripción general de federación de datos de copia cero

Al utilizar Copia cero, los arquitectos deben elegir entre tres métodos de federación de datos disponibles, cada uno de los cuales ofrece sus propias ventajas entre frescura, rendimiento y coste.

  • Consulta en vivo
    • Ejecuta consultas directamente en sistemas externos (por ejemplo, Snowflake, Google BigQuery, Redshift, Databricks, etc.) sin duplicación de datos.
    • Minimiza el movimiento de datos a través de la red y reduce la E/S en el cálculo de Salesforce Data 360, que es óptimo cuando se pueden empujar predicados y agregaciones hacia abajo.
    • Adecuado para perspectivas en tiempo real y paneles operativos de baja latencia.
    • Dependiendo del rendimiento del sistema externo.
  • Almacenamiento en caché (Consulta acelerada)
    • Almacena temporalmente copias en caché de datos federados en Salesforce Data 360.
    • Reduce los costes y la latencia de consultas repetidas para conjuntos de datos a los que se accede con frecuencia con duración configurable (minutos a días).
    • Los datos no se copian de forma permanente ni se rigen completamente, de modo que la actualización se gestiona a través de actualizaciones programadas desde el origen.
    • La actualización incremental solo admite alteraciones. Los registros eliminados no se eliminan de la memoria caché.
    • Realice una actualización completa periódicamente para garantizar que la memoria caché permanece sincronizada con el origen.
    • Nota: El conector de Snowflake admite la función Descargar, que mejora los índices de aceleración utilizando un depósito de preparación iniciado por Snowflake. Esto está activado de forma predeterminada, pero se puede desactivar modificando la conexión.
  • Federación de archivos
    • Proporciona acceso directo de solo lectura a conjuntos de datos a gran escala en establecimientos de objetos (por ejemplo, S3 y GCS con Iceberg).
    • Adecuado para cargas de trabajo de IA/ML, análisis históricos y creación de informes a escala de petabytes sin mover datos.
    • El rendimiento de las consultas depende en gran medida del formato del objeto, la partición y la E/S de red. Las exploraciones de gran tamaño pueden generar E/S sustanciales si no están optimizadas.
  • Casos de uso
    • La personalización en tiempo real y flujos de trabajo adaptativos entregan ofertas dinámicas, recomendaciones y las siguientes mejores acciones a medida que cambian los comportamientos de los clientes.
    • Los paneles en vivo y los KPI críticos para el negocio se potencian directamente desde almacenes externos.
    • El entrenamiento de modelos de IA/ML con grandes conjuntos de datos externos aprovecha datos a escala de petabytes desde lagos de datos y almacenes sin moverlos a través de Federación de archivos.
  • Escenarios industriales
    • Retail/Media: Active recomendaciones personalizadas e implicación de clientes en tiempo real federando datos de interacciones de contenido o transmisiones de clics.
    • Finanzas: Ejecute la detección de fraudes y la puntuación de riesgos casi en tiempo real consultando almacenes externos sin duplicar datos confidenciales.
    • Tech/Enterprise: Admite informes entre nubes, paneles de servicio de TI y análisis operativos cuando los conjuntos de datos residen en múltiples sistemas.
  • Prácticas de diseño
    • Consulta en vivo
      • Utilizar para consultas de alto QPS y baja latencia cuando la actualización es crítica.
      • Distribuya predicados y agregaciones al sistema externo para reducir la mezcla de datos en la red.
      • Evite consultas que exploran innecesariamente volúmenes de datos masivos.
      • Considere la poda de particiones y filtros en su lugar.
    • Federación de archivos
      • Acceda a conjuntos de datos a escala de petabytes en establecimientos de objetos sin introducción.
      • Minimice los costes de salida y latencia manteniendo el almacenamiento de objetos en la misma región de Cloud que el cálculo de Salesforce.
      • Utilice formatos particionados y columnares (Parquet/ORC) y filtros desplegables para reducir la transferencia de E/S y de red.
      • Aproveche la distribución de consultas y predicados para filtrar y agregar datos en el origen, lo que reduce el movimiento de datos.
      • Evite el acceso a datos entre regiones, a menos que sea absolutamente necesario, ya que aumenta la E/S, la latencia y los costes.
    • Almacenamiento en caché (Consulta acelerada)
      • Almacena en caché conjuntos de datos a los que se accede con frecuencia para equilibrar coste y rendimiento.
      • Configure intervalos de actualización para equilibrar la actualización frente al coste de consulta.
    • Cumplimiento: Aplique la regulación en el origen aprovechando la seguridad a nivel de filas y enmascarando políticas directamente en sistemas federados.
      • Estas son algunas prácticas recomendadas para el enmascaramiento y el RLS uniforme entre plataformas:
        • Utilice un Id. de empresa centralizado. Asigne usuarios y entidades en Salesforce Data 360 a un identificador de empresa único y centralizado que se corresponda con identidades en sistemas externos.
        • Alinear políticas de seguridad. Asegúrese de que RLS y las políticas de enmascaramiento en sistemas federados se aplican basándose en la identidad asignada. Esto mantiene el cumplimiento al consultar datos externos.
        • Estandarizar esquemas de identidad. Mantenga atributos de identidad coherentes (correo electrónico, Id. de usuario, Id. de cliente, etc.) en todos los orígenes de datos para evitar desajustes e infracciones de acceso.
  • Consideraciones de costes
    • Consulta en vivo: En el modelo de pago por consulta, los costes se acumulan en el cálculo de casas de lago externas, lo que puede provocar picos con un alto QPS. Esto es adecuado para casos de uso críticos para la frescura donde el valor es superior a la variabilidad de costes.
    • Consulta acelerada (almacenamiento en caché): Este método reduce el coste de la consulta (en comparación con Live Query) al reducir las visitas al sistema de origen; sin embargo, aumenta los costes de introducción de datos por lotes para rellenar y actualizar la memoria caché. Esto es adecuado para conjuntos de datos a los que se accede con frecuencia.
    • Federación de archivos: Esta es la opción de almacenamiento más económica como datos en Object Store; sin embargo, los costes de consulta dependen del tamaño del archivo, la partición y la poda. Esto es adecuado para datos históricos o masivos a escala de petabytes.
Punto de decisiónConsulta en vivoAlmacenamiento en caché (Consulta acelerada)Federación de archivos
Ubicación de origen de datosCasas de lago de datos externas (por ejemplo, Snowflake, Google BigQuery, Redshift y Databricks)Casas de lago de datos externas (por ejemplo, Snowflake, Google BigQuery, Redshift y Databricks)Establecimientos de objetos o lagos de datos de Cloud (por ejemplo, S3, ADLS y GCS), que a menudo utilizan formatos de tabla abierta como Iceberg.
Propósito/Caso de usoAdecuado para análisis interactivos y paneles en tiempo real. Adecuado para la personalización en tiempo real y flujos de trabajo dinámicos.Adecuado para cuando las consultas son frecuentes, pero los resultados ligeramente obsoletos son aceptables. Adecuado para paneles y segmentación de BI.Adecuado para el procesamiento por lotes a gran escala y el entrenamiento de modelos de IA/ML. Adecuado para análisis históricos y creación de informes a escala de petabytes.
Frescura/LatenciaProporciona la máxima actualización Ejecuta consultas directamente en tiempo real. Admite la decisión de subsegundos cuando el sistema de origen está optimizado para consultas de baja latencia con distribución de predicados efectiva.Utilizar cuando los resultados ligeramente obsoletos son aceptables. La actualización depende del intervalo de caché, que es configurable de 15 minutos a 7 días.Adecuado para trabajos por lotes intensivos en rendimiento. No es adecuado para paneles en tiempo real.
Patrón de accesoAdecuado para consultas poco frecuentes o ad-hoc donde la actualización es crítica y el volumen de consulta es bajo. Los costes se disparan significativamente con un QPS alto, por lo que es importante evaluar el almacenamiento en caché (Consulta acelerada) cuando la frecuencia de consulta es alta.Adecuado para escenarios de lectura de alta frecuencia. Mejora el rendimiento para patrones de acceso frecuentes.Proporciona acceso de solo lectura. Adecuado para conjuntos de datos a escala de petabytes sin introducción.
Controladores de rendimientoAltamente dependiente del rendimiento del sistema de origen externo. Adecuado para cuando los predicados y agregaciones se pueden empujar hacia abajo al origen.Reduce la latencia en comparación con consultas en vivo repetidas. El rendimiento depende de la gestión de caché y los intervalos.El rendimiento depende en gran medida del formato del objeto, la partición y el rendimiento del sistema externo. Utilice formatos particionados y de columnas (Parquet/ORC).
Consecuencias de costesEste es un modelo de pago por consulta, de modo que los costes se acumulan en cálculos de casas de lago externas. Es rentable para consultas poco frecuentes, pero los gastos pueden aumentar con un alto volumen de QPS.El coste es inferior a las consultas en vivo repetidas. Reduce la necesidad de consultar repetidamente el origen externo, pero agrega almacenamiento en caché y gastos generales de actualización.Esta es la opción de almacenamiento más barata. Para configuraciones de AWS de la misma región y misma nube (por ejemplo, S3 en EE.UU.-Este-1 con un arrendatario de Data Cloud que también está en EE.UU.-Este-1), los créditos no se consumen para las filas a las que se accede. Las configuraciones entre regiones o entre nubes (por ejemplo, Azure, GCS o diferentes regiones de AWS) generan consumo de crédito para las filas a las que se accede. Los costes de consulta también dependen del tamaño del archivo, la partición y la optimización de distribución de predicados.
Consideración claveEvite consultas sin filtrar que exploran volúmenes de datos masivos innecesariamente.Este enfoque requiere gestión de caché. No es adecuado para la decisión de subsegundos.El rendimiento de las consultas se basa en gran medida en la optimización a través de particiones y distribución de predicados.

Las arquitecturas híbridas permiten a los arquitectos anclar conjuntos de datos críticos en Data 360 para una gobernanza centralizada, al tiempo que aprovechan las consultas federadas para la actualización, la reducción de la duplicación y el acceso ampliable a conjuntos de datos externos de gran tamaño. Este enfoque equilibra las E/S, calcula la localidad, el coste y los requisitos de cumplimiento.

Utilice un enfoque híbrido para una regulación equilibrada, la actualización y la eficiencia operativa combinando la introducción de datos y la copia cero para entregar perspectivas sobre las que se pueden realizar acciones en tiempo real. Utilice la introducción para conjuntos de datos regulados de alto valor donde se requiere trazabilidad, RLS y enmascaramiento, y la federación para conjuntos de datos efímeros o de gran volumen donde la actualización y el rendimiento son clave.

Descripción general de enfoque híbrido
  • Casos de uso
    • Implicación OmniCanal: Combine datos históricos de clientes con comportamiento en tiempo real para entregar experiencias coherentes y conscientes del contexto.
    • Oportunidades en curso de IA/ML: Entrene modelos en conjuntos de datos canónicos depurados mientras los enriquece con señales sin procesar o en tiempo real procedentes de fuentes externas.
    • Cumplimiento mixto y necesidades de agilidad: Aplique una regulación estricta para datos confidenciales y una federación para la agilidad operativa.
  • Escenarios industriales
    • Retail: Utilice la introducción para la resolución de identidad y la unificación de perfiles, así como la federación para ofertas y personalización en tiempo real.
    • Asistencia sanitaria: Mantenga registros de pacientes dorados a través de la introducción mientras utiliza la federación en transmisiones de dispositivos de IoT y datos de sensores para contexto inmediato.
    • Servicios financieros: Introduzca datos regulados en un lago regulado por el cumplimiento mientras utiliza la federación para consultas de detección de fraude externo y supervisión de riesgos.
  • Prácticas de diseño
    • Gobernanza de delimitador con introducción: Introduzca datos de alto valor o regulados en modelos canónicos para garantizar Trust y cumplimiento.
    • Utilizar Federation for Freshness: Permite a las casas de lago externas proporcionar acceso a datos en tiempo real o a gran escala sin duplicación.
    • Equilibrar coste frente a rendimiento: Perfile las cargas de trabajo para determinar cuándo utilizar la introducción frente a la federación, lo que minimiza los costes de almacenamiento y consulta innecesarios.
    • Aplicar gobernanza por capas: Aplique la regulación centralizada para los datos introducidos mientras aprovecha los controles de seguridad de los sistemas federados (por ejemplo, RLS y enmascaramiento).
    • Nota: Cuando está diseñando oportunidades en curso híbridas, es importante garantizar la introducción incremental para conjuntos de datos históricos y distribuir agregaciones o filtros a orígenes federados para optimizar la E/S y calcular el uso.
  • Consideraciones de costes
    • Sopese el coste total frente al rendimiento combinando la ingesta de datos críticos o de cumplimiento con la federación cuando es necesario actualizar.
    • Tenga en cuenta las E/S y calcule la distribución al mezclar la introducción y la federación. Para reducir el coste de computación de consultas repetidas en sistemas de origen, utilice el almacenamiento en caché (Consulta acelerada) para conjuntos de datos federados de alta lectura y acceso frecuente.
    • Utilice esta regla para guiar la decisión de ingreso frente a federación: cuando se accede a los datos con frecuencia pero cambia con poca frecuencia, Consulta acelerada suele ser más rentable. Sin embargo, cuando los datos cambian con frecuencia (en relación con la frecuencia de acceso), Live Query o la introducción es más apropiada. Estos son algunos ejemplos de costes:
      • La aceleración gana: Un panel creado a partir de 1 millón de registros y actualizado diariamente con ~10.000 cambios se visualiza 20 veces al día. Los costes de aceleración equivalen a aproximadamente ~600 créditos/mes frente a ~4.200 créditos/mes para Consultas en vivo.
      • Live Query gana: Segmentos que se publican 20 veces al día utilizando datos que cambian cada 30 minutos. Las consultas en vivo cuestan aproximadamente ~4.200 créditos/mes frente a ~28.800 créditos/mes para la aceleración con esta frecuencia de actualización.

Echemos un vistazo con más detalle a algunos arquetipos comunes que ilustran cómo aplicar esta lógica.

  • El arquetipo “Fuente Única de la Verdad”: Centralizar y gobernar
    • Escenario: Necesita crear perfiles de Customer 360 unificados y compatibles para toda su empresa global. Los datos proceden de una docena de sistemas diferentes, deben cumplir con las estrictas leyes RGPD y CCPA, y servirán como la fuente de verdad para todas las interacciones de marketing y servicio.
    • Patrón recomendado: Ingestión de datos. La prioridad aquí es governance, Trust y control. Introducir los datos en Data 360 es la única forma de crear un perfil canónico completamente auditable aislado de los sistemas de origen.
  • El arquetipo “Perspectivas en tiempo real”: Analizar sin mover
    • Escenario: Su equipo de ciencia de datos necesita ejecutar consultas exploratorias en una tabla de transacciones masiva y en constante actualización en Snowflake. Al mismo tiempo, su equipo ejecutivo desea un panel de BI en vivo que funcione con esos mismos datos. Mover petabytes de datos diariamente es lento y costoso.
    • Patrón recomendado: Zero Copy Federation. La prioridad aquí es la velocidad, agilidad y rentabilidad a escala. Copia cero le permite aprovechar la potencia de su almacén de datos existente para consultas en tiempo real sin el gasto general y la latencia de la duplicación de datos.
  • El arquetipo “Inteligencia híbrida”: Gobernar el núcleo, federar la ventaja
    • Escenario: Desea enriquecer sus perfiles de clientes gobernados e introducidos con señales de comportamiento en tiempo real (por ejemplo, clics de sitio web) desde un lago de datos. Necesita la estabilidad del perfil principal pero la inmediatez de los datos en vivo para potenciar la personalización en el momento.
    • Patrón recomendado: Un enfoque híbrido. Utilice Ingestión de datos para crear un núcleo estable y gobernado para sus datos de clientes. Utilice Copia cero para federar los datos “borde” volátiles en tiempo real, y luego unirlos entre sí en el momento de la consulta para una vista completa y actualizada.

La estrategia de datos de empresa ya no se centra en elegir un patrón de integración único, sino que se trata de diseñar flexibilidad controlada dentro de un ecosistema de datos interoperable. El enfoque correcto asigna cada sistema de origen al patrón que mejor se adapte a sus requisitos de actualización, regulación, coste y acceso:

  • Introduzca conjuntos de datos regulados de misión crítica en Salesforce Data Cloud para el cumplimiento, la resolución de identidad y los flujos de trabajo operativos.
  • Genere datos a través de Copia cero para análisis en vivo, exploratorios y dirigidos por IA sin duplicar el almacenamiento.
  • Aplicar almacenamiento en caché (Consulta acelerada) para reducir la carga del sistema de origen y el consumo de crédito cuando la frecuencia de consulta es alta y la frecuencia de cambio de datos es baja

Salesforce Data 360 en Hyperforce ofrece resiliencia y capacidad de ampliación de múltiples regiones. Su casa de lago abierta con tablas de Iceberg permite la separación de cálculos y la interoperabilidad con plataformas como Snowflake, Databricks y S3 Iceberg, que forma la columna vertebral de un ecosistema de datos multinube realmente interoperable.

A medida que evolucionan los ecosistemas de datos, debemos equilibrar continuamente la frescura, el coste, el rendimiento y el cumplimiento para mantener la agilidad arquitectónica. Por eso es importante preparar su plataforma para el futuro unificando datos introducidos y gobernados con acceso federado. Esto permite la inteligencia en tiempo real, la activación de IA y la personalización a escala empresarial entre nubes, regiones y dominios comerciales.

Tenga en cuenta que las soluciones únicas no se adaptan a la mayoría de los negocios. La estrategia óptima asigna el patrón correcto al controlador comercial correcto.

Yugandhar Bora es un Arquitecto de Ingeniería de Software de Salesforce que se especializa en arquitectura de datos dentro de la plataforma Aplicaciones de datos e inteligencia. Lidera iniciativas de la junta de revisión de arquitectura empresarial (EARB) que se centran en la gobernanza de datos y modelos de datos unificados, al tiempo que contribuye a soluciones de aprovisionamiento de plataformas automatizadas.

Jan Fernando es Arquitecto Principal de la Oficina del Arquitecto Jefe (OCA) de Salesforce, que se unió a Salesforce en 2012, y aporta una gran experiencia de su etapa en el ecosistema de startups. Antes de unirse a la OCA, pasó más de una década en la organización Platform, donde lideró varias transformaciones tecnológicas clave.