Resumen
La minería de datos o exploración de datos (es la etapa de
análisis de "Knowledge Discovery in Databases" o KDD) es un campo de
las ciencias de la computación referido al proceso que intenta descubrir
patrones en grandes volúmenes de conjuntos de datos.1 Utiliza los métodos de la
inteligencia artificial, aprendizaje automático, estadística y sistemas de
bases de datos. El objetivo general del proceso de minería de datos consiste en
extraer información de un conjunto de datos y transformarla en una estructura
comprensible para su uso posterior. Además de la etapa de análisis en bruto,
que involucra aspectos de bases de datos y de gestión de datos, de
procesamiento de datos, del modelo y de las consideraciones de inferencia, de
métricas de Intereses, de consideraciones de la Teoría de la complejidad
computacional, de post-procesamiento de las estructuras descubiertas, de la
visualización y de la actualización en línea.
El término es una palabra de moda, y es frecuentemente mal utilizado
para referirse a cualquier forma de datos a gran escala o procesamiento de la
información (recolección, extracción, almacenamiento, análisis y estadísticas),
pero también se ha generalizado a cualquier tipo de sistema de apoyo
informático decisión, incluyendo la inteligencia artificial, aprendizaje
automático y la inteligencia empresarial. En el uso de la palabra, el término
clave es el descubrimiento, comúnmente se define como "la detección de
algo nuevo". Incluso el popular libro "La minería de datos: sistema
de prácticas herramientas de aprendizaje y técnicas con Java" (que cubre
todo el material de aprendizaje automático) originalmente iba a ser llamado
simplemente "la máquina de aprendizaje práctico", y el término
"minería de datos" se añadió por razones de marketing. A menudo, los
términos más generales "(gran escala) el análisis de datos", o
"análisis" -. o cuando se refiere a los métodos actuales, la
inteligencia artificial y aprendizaje automático, son más apropiados.
Introducción
Día a día generamos información y esto nos lleva a tener una
gran cantidad de esta, lo cual implica que el generar información, nos puede
ayudar a controlar, optimizar, administrar, examinar, investigar, planificar,
predecir, someter, negociar o tomar decisiones de cualquier ámbito según el
dominio en que nos desarrollemos.
¿Qué es Minería de Datos?
- La extracción no trivial de información implícita,
previamente desconocida y potencialmente útil, a partir de datos.
- La
integración de un conjunto de áreas que tienen como propósito la identificación
de un conocimiento obtenido a partir de las bases de datos que aporten un sesgo
hacia la toma de decisión.
Proceso de Minería de Datos
1. Selección
del conjunto de datos, tanto en lo que se refiere a las variables objetivo
(aquellas que se quiere predecir, calcular o inferir), como a las variables
independientes (las que sirven para hacer el cálculo o proceso), como
posiblemente al muestreo de los registros disponibles.
2. Análisis
de las propiedades de los datos, en especial los histogramas, diagramas de
dispersión, presencia de valores atípicos y ausencia de datos (valores nulos).
3. Transformación
del conjunto de datos de entrada, se realizará de diversas formas en función
del análisis previo, con el objetivo de prepararlo para aplicar la técnica de
minería de datos que mejor se adapte a los datos y al problema, a este paso
también se le conoce como preprocesamiento de los datos.
4. Seleccionar
y aplicar la técnica de minería de datos, se construye el modelo predictivo, de
clasificación o segmentación.
5. Extracción
de conocimiento, mediante una técnica de minería de datos, se obtiene un modelo
de conocimiento, que representa patrones de comportamiento observados en los
valores de las variables del problema o relaciones de asociación entre dichas
variables. También pueden usarse varias técnicas a la vez para generar
distintos modelos, aunque generalmente cada técnica obliga a un preprocesado
diferente de los datos.
6. Interpretación
y evaluación de datos, una vez obtenido el modelo, se debe proceder a su
validación comprobando que las conclusiones que arroja son válidas y
suficientemente satisfactorias. En el caso de haber obtenido varios modelos
mediante el uso de distintas técnicas, se deben comparar los modelos en busca
de aquel que se ajuste mejor al problema. Si ninguno de los modelos alcanza los
resultados esperados, debe alterarse alguno de los pasos anteriores para
generar nuevos modelos.
Los pasos a seguir para la realización de un proyecto de
minería de datos son:
1. La Determinación de los Objetivos. Trata sobre la
delimitación de los objetivos que el cliente desea
2. Pre procesamiento de los Datos. Se refiere a la
selección, la limpieza, el enriquecimiento, la reducción y transformación de
las bases de datos.
Principales Características de MD
Explorar los datos que se encuentran en las profundidades de
las bases de datos, o almacenes de datos, que algunas veces contienen
información almacenada durante varios años.
• El entorno de la minería de datos suele tener una
arquitectura cliente-servidor.
• Las herramientas de la minería de datos ayudan a extraer
el mineral de la información enterrado en archivos corporativos o en registros
públicos archivados.
• Las herramientas de la minería de datos se combinan
fácilmente y pueden analizarse y procesarse rápidamente.
• La minería de datos
produce cinco tipos de información:
— Asociaciones.
— Secuencias.
— Clasificaciones.
— Agrupamientos.
— Pronósticos.
¿Qué es el proceso de KDD?
Extracción de Conocimiento en Bases de Datos
- Es la
extracción automatizada de conocimiento o patrones interesantes, no triviales,
implícitos, previamente desconocidos, potencialmente útiles y predictivos de la
información de grandes Bases de Datos.(3)
- El
proceso de KDD consiste en usar métodos de minería de datos(algoritmos) para
extraer (identificar) lo que se considera como conocimiento de acuerdo a la
especificación de ciertos parámetros usando una base de datos junto con
pre-procesamientos y post-procesamientos.
Fases del KDD
• Determinar
las fuentes de información.
• Diseñar
el esquema de un almacén de datos (Data Warehouse): que consiga unificar de
manera operativa toda la información recogida.
• Implantación
del almacén de datos: que permita la navegación y visualización previa de sus
datos, para decidir qué aspectos puede interesar que sean estudiados.
• Selección, limpieza y transformación de los datos que se
van a analizar: la selección incluye
tanto una división o fusión horizontal (filas) como vertical
(atributos).La limpieza y prepocesamiento de datos se logra diseñando una
estrategia adecuada para manejar errores, valores incompletos, secuencias de
tiempo, etc.
• Seleccionar
y aplicar el método de minería de datos apropiado: esto incluye la selección de
la tarea de descubrimiento a realizar, por ejemplo, clasificación, agrupamiento
o clustering, regresión, etc. La transformación de los datos al formato
requerido por el algoritmo específico de minería de datos.
• Evaluación,
interpretación, transformación y representación de los patrones extraídos,
interpretar los resultados y posiblemente regresar a los pasos anteriores. Esto
puede involucrar repetir el proceso, quizás con otros datos, otros algoritmos,
otras metas y otras estrategias.
• Difusión
y uso del nuevo conocimiento. Incorporar el conocimiento descubierto al sistema
lo cual puede incluir resolver conflictos existentes. El conocimiento se
obtiene para realizar acciones o la toma de decisiones.
Técnicas de minería de datos
• Como ya
se ha comentado, las técnicas de la minería de datos provienen de la
inteligencia artificial y de la estadística, dichas técnicas, no son más que
algoritmos, más o menos sofisticados que se aplican sobre un conjunto de datos
para obtener unos resultados.
Las técnicas más representativas son:
• Redes
neuronales.- Son un paradigma de aprendizaje y procesamiento automático
inspirado en la forma en que funciona el sistema nervioso de los animales. Se
trata de un sistema de interconexión de neuronas en una red que colabora para
producir un estímulo de salida. Algunos ejemplos de red neuronal son:
• El
perceptrón.
• El
perceptrón multicapa.
• Los mapas
auto organizado, también conocidos como redes de Kohonen.
• Regresión
lineal.- Es la más utilizada para formar relaciones entre datos. Rápida y
eficaz pero insuficiente en espacios multidimensionales donde puedan
relacionarse más de 2 variables.
• Árboles
de decisión.- Un árbol de decisión es un modelo de predicción utilizado en el
ámbito de la inteligencia artificial, dada una base de datos se construyen
estos diagramas de construcciones lógicas, muy similares a los sistemas de
predicción basados en reglas, que sirven para representar y categorizar una
serie de condiciones que suceden de forma sucesiva, para la resolución de un
problema. Ejemplos:
• Algoritmo
ID3.
• Algoritmo
C4.5.
• Modelos
estadísticos.- Es una expresión simbólica en forma de igualdad o ecuación que
se emplea en todos los diseños experimentales y en la regresión para indicar
los diferentes factores que modifican la variable de respuesta.
• Agrupamiento
o Clustering.- Es un procedimiento de agrupación de una serie de vectores según
criterios habitualmente de distancia; se tratará de disponer los vectores de
entrada de forma que estén más cercanos aquellos que tengan características
comunes. Ejemplos:
• Algoritmo
K-means.
• Algoritmo
K-medoids.
• Reglas de
asociación.- Se utilizan para descubrir hechos que ocurren en común dentro de
un determinado conjunto de datos.
Según el objetivo del análisis de los datos, los algoritmos
utilizados se clasifican en supervisados y no supervisados (Weiss y Indurkhya,
1998):
• Algoritmos
supervisados (o predictivos): predicen un dato (o un conjunto de ellos) desconocido
a priori, a partir de otros conocidos.
• Algoritmos
no supervisados (o del descubrimiento del conocimiento): se descubren patrones
y tendencias en los datos.
¿Qué es un modelo de minería de datos?
La minería de datos se aplica a todo tipo de datos
imaginable: desde datos numéricos a imágenes de
Satélite, mamografías, música, archivos de ordenador,
imágenes, etc. Podemos decir que “cualquier
Cosa” constituye un dato. Por tanto la minería de datos
tiene infinitas aplicaciones: comerciales,
Marketing, industria, internet, agricultura, etc.
Con miles de datos, necesitamos limpiarlos (eliminar
fragmentos inútiles, repetidos, etc.) y organizarlos, y una vez realizado este
proceso decimos que tenemos “Información”.
La información hay que tratarla con un modelo para obtener
resultados o conclusiones a los que
Llamamos “Conocimiento”. Es decir, el conocimiento es
información analizada. Para este análisis hay
diferentes modelos de minería de datos. Digamos que un
modelo es una forma de aplicar un
tratamiento a una cantidad masiva de datos para extraer
información de ellos.
Conclusiones y algo sobre el futuro de la minería de datos
La minería de datos es algo más allá de la estadística
tradicional (cálculo de medias, análisis de varianza,
etc.). Mientras que en Estados Unidos su sanidad usa ya
técnicas de minería de datos, en la mayoría de
los países los sistemas sanitarios se apoyan aún en la
estadística tradicional de principios de siglo XX.
Referencias
- (1)http://www.daedalus.es/mineria-de-datos/
- (2)(Molina
y otros, 2001)
-
(3)http://www.monografias.com/trabajos55/mineria-de-datos/mineria-de-datos.shtm
-(4)http://www.uccor.edu.ar/paginas/seminarios/Cursos/DM-Medicine/Clase1-FIUNER.pdf
-(5)http://www.microsoft.com/business/smb/es-es/tecnologia/data_mining.mspx
-(6)
http://www.tecnicas.com/conceptos/data-mining/metodos.aspx
-(7)http://www.scielo.org.co/scielo.php?pid=S0120-56092009000100008&script=sci_arttext
-(8)http://www.youtube.com/watch?v=-aPU13W7Xvw&NR=1&feature=fvwp
-(9)http://www.youtube.com/watch?v=CBLRKqHoAIs&NR=1
http://ccc.inaoep.mx/~emorales/Cursos/KDD03/node7.html
No dejar todo para ultima hora, editar el documento, y organizar con un indice la secuencia
ResponderBorrarbien
ResponderBorrarmuy bueno tu tema me va hacer muy util mas adelante joven lo felicito jeje
ResponderBorrar