Comprender los datos antes de utilizarlos
Conocimiento en Ciencia de Datos para la era de la Inteligencia Artificial: datos, estadística, analítica, aprendizaje automático, ingeniería de datos, visualización e Inteligencia Artificial.
Conocimiento en Ciencia de Datos
La Ciencia de Datos combina datos, estadística, matemáticas, computación, analítica y conocimiento del ámbito de aplicación para extraer conocimiento de la información y utilizarlo para comprender, predecir y tomar mejores decisiones.
La llegada de la Inteligencia Artificial está transformando profundamente la forma de trabajar con datos. Podemos analizar información, escribir código, generar visualizaciones y desarrollar modelos con una rapidez cada vez mayor.
Pero disponer de herramientas más capaces hace todavía más importante comprender los fundamentos.
¿Qué representan nuestros datos? ¿Qué calidad tienen? ¿Qué podemos inferir de ellos? ¿Qué incertidumbre existe? ¿Qué modelo resulta adecuado? ¿Cómo evaluamos sus resultados? ¿Podemos confiar en las conclusiones?
En CienciaDeDatos.pro construimos progresivamente una base de conocimiento en Ciencia de Datos para estudiar estas cuestiones con rigor y conectarlas con problemas reales.
Áreas de conocimiento
Un mapa para comprender la Ciencia de Datos
La Ciencia de Datos no es una única técnica ni una colección de herramientas. Es un ámbito interdisciplinar en el que diferentes conocimientos trabajan conjuntamente.
Organizamos sus contenidos alrededor de ocho grandes áreas.
1. Datos
La materia prima de la Ciencia de Datos
Todo comienza con los datos.
Antes de analizar, predecir o utilizar Inteligencia Artificial necesitamos comprender qué información tenemos, cómo se ha generado, qué representa y qué limitaciones presenta.
En esta área estudiamos:
- tipos y estructuras de datos;
- obtención y recopilación;
- limpieza y transformación;
- preparación de datos;
- calidad;
- valores ausentes y anomalías;
- integración de diferentes fuentes;
- datos estructurados y no estructurados;
- conjuntos de datos;
- documentación y metadatos.
El objetivo no es simplemente disponer de más datos, sino disponer de datos adecuados para el problema que queremos resolver.
[Explorar Datos →]
2. Estadística y Probabilidad
Razonar con datos y bajo incertidumbre
Los datos contienen variabilidad, ruido e incertidumbre.
La estadística y la probabilidad proporcionan los fundamentos necesarios para describir fenómenos, formular hipótesis, realizar inferencias y evaluar hasta qué punto podemos confiar en nuestras conclusiones.
Abordamos cuestiones como:
- estadística descriptiva;
- probabilidad;
- variables aleatorias;
- distribuciones;
- muestreo;
- estimación;
- intervalos de confianza;
- contrastes de hipótesis;
- correlación;
- regresión;
- inferencia estadística;
- diseño de experimentos;
- incertidumbre;
- causalidad.
En una época en la que obtener respuestas es cada vez más fácil, saber evaluar la evidencia que sustenta esas respuestas adquiere todavía mayor importancia.
[Explorar Estadística y Probabilidad →]
3. Analítica de Datos
De los datos a la comprensión
La analítica permite explorar información, identificar patrones, comprender comportamientos y apoyar la toma de decisiones.
Podemos utilizar los datos para responder preguntas progresivamente más complejas:
¿Qué ha sucedido?
Analítica descriptiva.
¿Por qué ha sucedido?
Analítica diagnóstica.
¿Qué puede suceder?
Analítica predictiva.
¿Qué deberíamos hacer?
Analítica prescriptiva.
En esta área conectamos métodos analíticos con problemas empresariales, científicos, sociales y profesionales.
El objetivo es transformar datos en información útil para comprender y decidir.
[Explorar Analítica de Datos →]
4. Aprendizaje Automático
Aprender patrones a partir de los datos
El aprendizaje automático permite desarrollar modelos capaces de identificar relaciones y patrones a partir de datos para realizar predicciones, clasificaciones, recomendaciones y otras tareas.
Estudiamos progresivamente:
- aprendizaje supervisado;
- aprendizaje no supervisado;
- regresión;
- clasificación;
- agrupamiento;
- reducción de dimensionalidad;
- selección de variables;
- entrenamiento de modelos;
- validación;
- métricas;
- generalización;
- sobreajuste;
- interpretación de modelos;
- series temporales;
- sistemas de recomendación.
Pero construir un modelo no es suficiente.
Una parte fundamental de la Ciencia de Datos consiste en comprender qué problema estamos intentando resolver, qué modelo resulta apropiado y cómo sabemos si realmente funciona.
[Explorar Aprendizaje Automático →]
5. Ingeniería de Datos
Hacer que los datos estén disponibles cuando se necesitan
Los análisis y modelos dependen de sistemas capaces de obtener, transformar, almacenar y proporcionar datos de manera fiable.
La ingeniería de datos construye esa infraestructura.
En esta área abordamos:
- bases de datos;
- modelado de datos;
- consultas;
- procesos de extracción, transformación y carga;
- canalizaciones de datos;
- integración;
- almacenamiento;
- procesamiento distribuido;
- datos en tiempo real;
- arquitecturas de datos;
- automatización;
- observabilidad;
- escalabilidad.
La Ciencia de Datos necesita buenos modelos.
Pero antes necesita datos disponibles, fiables y correctamente gestionados.
[Explorar Ingeniería de Datos →]
6. Visualización y Comunicación de Datos
Comprender y hacer comprensibles los datos
Un análisis adquiere valor cuando sus resultados pueden interpretarse y utilizarse.
La visualización permite explorar patrones, detectar anomalías, comparar magnitudes y comunicar información compleja de manera comprensible.
Pero comunicar datos implica mucho más que crear gráficos.
Estudiamos:
- principios de visualización;
- selección de gráficos;
- percepción visual;
- diseño de información;
- cuadros de mando;
- visualización exploratoria;
- visualización explicativa;
- narración con datos;
- comunicación de incertidumbre;
- presentación de resultados;
- comunicación para la toma de decisiones.
El objetivo no es hacer que los datos parezcan interesantes.
Es conseguir que la información importante pueda comprenderse correctamente.
[Explorar Visualización y Comunicación →]
7. Datos e Inteligencia Artificial
Preparar los datos para nuevos sistemas inteligentes
La Inteligencia Artificial está ampliando las posibilidades de utilización de los datos.
Los modelos generativos pueden trabajar con lenguaje, documentos, imágenes y otras formas de información. Los nuevos sistemas pueden recuperar conocimiento, utilizar herramientas, combinar diferentes fuentes y ejecutar tareas de manera cada vez más autónoma.
Estas capacidades introducen nuevas cuestiones relacionadas con los datos.
En esta área estudiamos:
- preparación de datos para Inteligencia Artificial;
- datos estructurados y no estructurados;
- calidad de datos para sistemas de IA;
- recuperación de información;
- representaciones vectoriales;
- bases de datos vectoriales;
- recuperación aumentada mediante generación;
- bases de conocimiento;
- grafos de conocimiento;
- datos sintéticos;
- evaluación;
- sistemas basados en agentes;
- contexto y memoria;
- trazabilidad.
La Inteligencia Artificial amplía nuestra capacidad para trabajar con información, pero sigue existiendo una cuestión fundamental:
¿Con qué datos y conocimiento está trabajando el sistema?
[Explorar Datos e Inteligencia Artificial →]
8. Gobierno, Calidad y Uso Responsable de los Datos
Poder utilizar los datos no significa que debamos utilizarlos de cualquier manera
A medida que los datos adquieren mayor importancia para las decisiones y los sistemas de Inteligencia Artificial, también aumentan las responsabilidades relacionadas con su utilización.
En esta área estudiamos:
- calidad del dato;
- gobierno del dato;
- propiedad y responsabilidad;
- trazabilidad;
- privacidad;
- seguridad;
- sesgos;
- ética;
- documentación;
- cumplimiento;
- explicabilidad;
- utilización responsable;
- evaluación de riesgos.
La confianza en los resultados depende también de cómo se obtienen, gestionan y utilizan los datos que los producen.
[Explorar Gobierno y Calidad →]
El proceso de la Ciencia de Datos
De una pregunta a una decisión
Las áreas anteriores no funcionan de manera aislada.
Un proyecto de Ciencia de Datos comienza normalmente con un problema, no con una tecnología.
Podemos representar el proceso de forma simplificada:
Problema → Preguntas → Datos → Preparación → Exploración → Análisis y modelización → Evaluación → Interpretación → Comunicación → Decisión → Seguimiento
En cada etapa aparecen preguntas diferentes con el conocimiento en Ciencia de Datos.
Comprender el problema
¿Qué queremos conocer, explicar, predecir u optimizar?
Comprender los datos
¿Qué información tenemos y qué representa realmente?
Preparar
¿Qué debemos limpiar, transformar, integrar o construir?
Analizar
¿Qué patrones y relaciones aparecen?
Modelizar
¿Podemos explicar o predecir el fenómeno mediante un modelo?
Evaluar
¿Funciona realmente? ¿Con qué limitaciones e incertidumbre?
Interpretar
¿Qué significan los resultados dentro del problema original?
Comunicar
¿Qué necesitan comprender las personas que utilizarán los resultados?
Decidir
¿Qué acción puede justificarse a partir de la evidencia disponible?
Esta perspectiva evita uno de los errores más frecuentes: empezar buscando una herramienta antes de comprender el problema.
Herramientas para Ciencia de Datos
Las herramientas importan. Los fundamentos importan más.
Python, R, SQL, cuadernos interactivos, bibliotecas estadísticas, herramientas de visualización, plataformas en la nube y sistemas de Inteligencia Artificial forman parte del trabajo cotidiano con datos.
CienciaDeDatos.pro también analizará estas herramientas.
Pero no organizaremos nuestro conocimiento alrededor de productos concretos.
Las tecnologías evolucionan rápidamente. Los principios estadísticos, analíticos y metodológicos son mucho más duraderos.
Por eso estudiaremos las herramientas dentro del problema que permiten resolver.
Python podrá aparecer al preparar datos.
SQL al consultarlos.
R al analizarlos estadísticamente.
Las bibliotecas de aprendizaje automático al desarrollar modelos.
Las herramientas de visualización al comunicar resultados.
Y la Inteligencia Artificial como apoyo transversal a numerosas fases del trabajo.
Primero comprender qué queremos hacer. Después seleccionar cómo hacerlo.
Ciencia de Datos aplicada
El conocimiento adquiere valor cuando se utiliza
Un mismo método puede adquirir significados muy diferentes dependiendo del ámbito en el que se aplica.
Una predicción puede estimar demanda turística, riesgo financiero, consumo energético, necesidades de inventario o mantenimiento de una máquina.
Un modelo de clasificación puede utilizarse en industria, finanzas, salud, comercio o administración pública.
Una serie temporal puede representar ventas, precios, temperatura, tráfico o producción.
Por eso conectamos nuestra base de conocimiento con aplicaciones en diferentes ámbitos:
- empresa y dirección;
- finanzas;
- turismo;
- industria y operaciones;
- logística;
- comercio exterior;
- ciudades y territorio;
- arquitectura y entorno construido;
- educación;
- sector público;
- ciencia y tecnología.
El conocimiento del ámbito de aplicación forma parte del propio proceso de Ciencia de Datos.
[Explorar Aplicaciones →]
Ciencia de Datos en la era de la Inteligencia Artificial
La Inteligencia Artificial está modificando la manera de aprender y practicar Ciencia de Datos.
Un profesional puede utilizarla para explicar conceptos, generar código, depurar errores, formular consultas, explorar datos, proponer visualizaciones, documentar procesos o desarrollar prototipos.
Esto puede aumentar extraordinariamente la productividad.
También introduce un riesgo: confundir la capacidad de generar una respuesta con la capacidad de evaluar si esa respuesta es correcta.
Por eso consideramos que la formación en fundamentos adquiere todavía mayor valor.
Estadística.
Probabilidad.
Calidad de datos.
Experimentación.
Evaluación.
Conocimiento del dominio.
Pensamiento crítico.
Interpretación.
La Inteligencia Artificial puede ayudarnos en todas estas actividades, pero necesitamos desarrollar el criterio necesario para trabajar con ella.
Esta es una de las tesis fundamentales de CienciaDeDatos.pro:
En la era de la Inteligencia Artificial, aprender Ciencia de Datos significa cada vez menos memorizar cómo ejecutar tareas y cada vez más comprender los datos, los métodos y las decisiones que construimos a partir de ellos.
Construimos una base de conocimiento en español
CienciaDeDatos.pro irá desarrollando progresivamente contenidos con diferentes niveles de profundidad.
Conceptos para comprender los fundamentos.
Artículos para analizar cuestiones concretas.
Guías para estructurar áreas completas de conocimiento.
Casos para conectar métodos con problemas reales.
Cuadernos para investigar cuestiones con mayor profundidad.
Recursos para facilitar el aprendizaje y la práctica.
Informes para generar conocimiento propio.
Todos ellos formarán parte progresivamente de una misma arquitectura de conocimiento.
No buscamos publicar más.
Buscamos comprender mejor y construir conocimiento que siga siendo útil.
Explora la Ciencia de Datos
Puedes comenzar por cualquiera de nuestras grandes áreas:
[Datos →]
[Estadística y Probabilidad →]
[Analítica de Datos →]
[Aprendizaje Automático →]
[Ingeniería de Datos →]
[Visualización y Comunicación →]
[Datos e Inteligencia Artificial →]
[Gobierno y Calidad del Dato →]
O descubrir cómo este conocimiento se transforma en actividad profesional y aplicaciones reales:
[Profesión →]
[Aplicaciones →]
CienciaDeDatos.pro
Ciencia de Datos para la era de la Inteligencia Artificial.
Conocimiento, profesión y aplicación para comprender los datos, convertirlos en mejores decisiones y aprovechar todo su potencial en un mundo transformado por la Inteligencia Artificial.