Durante años, la industria de los datos ha debatido sobre un dilema recurrente: ¿cómo aprovechar las capacidades avanzadas de una plataforma sin quedar cautivo de ella?. En un mundo donde conviven motores de proceso, plataformas analíticas, agentes de IA, frameworks de Machine Learning y múltiples entornos cloud, la interoperabilidad se ha convertido en un requisito estratégico.
La reciente incorporación en Public Preview de la Iceberg Scan Plan API dentro de Snowflake Horizon Catalog representa mucho más que una nueva funcionalidad técnica. Es una nueva demostración de cómo los formatos abiertos, y especialmente Apache Iceberg, están transformando el diseño de las arquitecturas modernas de datos e inteligencia artificial.
El auge de Apache Iceberg
Apache Iceberg se ha consolidado como uno de los estándares abiertos más importantes del ecosistema analítico moderno. Su propuesta es simple pero revolucionaria: separar el almacenamiento de los datos de los motores que los consumen.
En lugar de almacenar la información en formatos propietarios ligados a una única plataforma, Iceberg permite que los datos residan en almacenamiento abierto (ADLS, S3, GCS, etc.) y puedan ser consumidos desde múltiples motores como:
- Snowflake
- Apache Spark
- Trino
- Databricks
- Flink
- PyIceberg
- Motores de IA y Machine Learning
Este enfoque elimina gran parte del tradicional vendor lock-in y permite construir arquitecturas mucho más flexibles, evolutivas y sostenibles.
La consecuencia es evidente: los datos pasan a convertirse en un activo compartido de la organización, y no en un recurso cautivo de una única tecnología.
El reto pendiente: la gobernanza
Aunque los estándares abiertos han resuelto gran parte del problema de la interoperabilidad, quedaba una cuestión fundamental:
¿Cómo garantizar que las políticas de seguridad y gobierno de datos se mantengan independientemente del motor que acceda a ellos?
Este problema se vuelve especialmente relevante cuando los mismos datos son utilizados simultáneamente por:
- Equipos de BI.
- Científicos de datos.
- Plataformas de IA Generativa.
- Aplicaciones operacionales.
- Usuarios de negocio.
Hasta ahora era relativamente sencillo compartir los datos mediante Iceberg, pero mucho más complejo garantizar que las políticas de acceso siguieran aplicándose de forma consistente.
La respuesta de Snowflake Horizon Catalog
Snowflake acaba de introducir la capacidad de aplicar políticas de protección sobre tablas Apache Iceberg consultadas desde motores externos mediante Snowflake Horizon Catalog.
La documentación indica que Snowflake permite aplicar:
- Políticas de acceso a nivel de fila (Row Access Policies).
- Políticas de enmascaramiento de columnas (Masking Policies).
- Políticas basadas en etiquetas (Tag-Based Policies).
Lo verdaderamente interesante es que estas políticas pueden mantenerse incluso cuando los datos son consultados desde motores externos como:
- Apache Spark
- Trino
- PyIceberg
- Otros motores compatibles con el estándar Iceberg Scan Plan API.
En otras palabras:
La gobernanza deja de estar ligada al motor de consulta y pasa a viajar junto a los datos.
Y esta es una de las piezas clave que las arquitecturas de datos modernas necesitaban para alcanzar una verdadera interoperabilidad empresarial.
Iceberg Scan Plan API: un pequeño anuncio con grandes implicaciones
La nota de lanzamiento publicada por Snowflake el 10 de septiembre de 2026 anuncia la disponibilidad en public preview de la Iceberg Scan Plan API en Horizon Catalog.
Aunque pueda parecer una característica menor, su relevancia es notable.
Según la documentación, Snowflake ofrece ahora dos mecanismos para aplicar políticas sobre tablas Iceberg desde motores externos:
- Snowflake Connector for Spark, que enruta las consultas a través de Snowflake.
- Iceberg REST Catalog Scan Plan API, que comparte temporalmente un conjunto de datos filtrado según las políticas definidas.
La segunda opción resulta especialmente interesante porque permite trabajar con cualquier motor compatible con el estándar Iceberg, evitando dependencias específicas de conectores propietarios. Esto supone una evolución muy significativa hacia ecosistemas realmente abiertos.
¿Por qué es tan relevante para la IA?
La respuesta está en la creciente fragmentación tecnológica de los entornos de inteligencia artificial. Hoy es habitual encontrar organizaciones donde:
- Snowflake actúa como plataforma de datos corporativa.
- Spark ejecuta procesos de ingeniería de datos.
- Frameworks de IA consumen datos mediante Python.
- Modelos RAG utilizan índices vectoriales externos.
- Distintos agentes de IA acceden a conjuntos de datos compartidos.
En este contexto, obligar a que todos los accesos pasen por una única plataforma limita la escalabilidad y la innovación. Apache Iceberg permite que múltiples herramientas trabajen sobre los mismos datos. Y ahora, con las capacidades anunciadas por Snowflake, también es posible mantener de forma consistente las políticas de gobierno definidas por la organización.
Esto aproxima cada vez más el paradigma de:
«Write once, govern once, consume everywhere.»
El futuro: marketplaces, agentes y ecosistemas abiertos
La tendencia del sector es clara. Los grandes fabricantes están convergiendo hacia modelos donde:
- Los datos permanecen en formatos abiertos.
- Los motores de proceso son intercambiables.
- La gobernanza se centraliza.
- Los agentes de IA consumen datos desde múltiples plataformas.
En este escenario, estándares como Apache Iceberg se convierten en un habilitador estratégico. Ya no hablamos únicamente de eficiencia técnica. Hablamos de:
- Reducir dependencia tecnológica.
- Facilitar migraciones futuras.
- Incrementar la reutilización del dato.
- Acelerar iniciativas de IA.
- Simplificar la colaboración entre plataformas.
La interoperabilidad deja de ser una característica técnica para convertirse en una capacidad empresarial.
Conclusión
Llevo tiempo comentando que una de las batallas más importantes en el mundo de los datos no será quién almacene la información, sino quién facilite mejor su interoperabilidad. La incorporación de la Iceberg Scan Plan API en Snowflake Horizon Catalog es otro ejemplo de cómo la industria está avanzando hacia arquitecturas más abiertas, donde el valor ya no reside únicamente en custodiar los datos, sino en permitir que múltiples motores, herramientas y agentes de IA puedan utilizarlos de forma segura y gobernada.
En mi opinión, este movimiento confirma una tendencia que venimos observando desde hace tiempo: el futuro de las plataformas analíticas pasa por abrazar estándares abiertos como Apache Iceberg, permitiendo combinar lo mejor de cada ecosistema sin sacrificar el control, la seguridad ni el gobierno corporativo. Porque, en las arquitecturas modernas de datos e IA, la verdadera ventaja competitiva ya no es tener los datos encerrados en una plataforma, sino ser capaz de hacer que trabajen libremente en todas ellas.
Referencias
Snowflake. (2026, 10 de septiembre). Iceberg Scan Plan API in Horizon Catalog (Public Preview). Snowflake Documentation. Recuperado el 21 de septiembre de 2026, de https://docs.snowflake.com/en/release-notes/2026/other/2026-09-10-iceberg-scan-plan-api-public-preview
Snowflake. (2026). Enforce data protection policies on Apache Iceberg™ tables from external query engines. Snowflake Documentation. Recuperado el 21 de septiembre de 2026, de https://docs.snowflake.com/en/user-guide/tables-iceberg-query-using-external-query-engine-snowflake-horizon-enforce-access-policies
Foto de portada gracias a Stephen Leonardi: https://www.pexels.com/es-es/foto/resfriado-frio-glaciar-iceberg-28133583/