¿Qué es la Mineria de Datos?
Hola, ¿qué tal? Eh, mi nombre es José
Manuel Armas y en el video de hoy, en la
exposición de hoy, eh vamos a tratar el
tema de la minería de datos,
específicamente titulado esta
presentación minería de datos aspectos
básicos, ya que a lo largo de ella vamos
a tratar los conceptos y fundamentos
básicos de la minería de datos, más que
todo la superficie de la minería de
datos, de manera que una persona que no
esté familiarizada con este tema no lo
conozca. Espero que al final de la
presentación tenga una idea básica de
qué es la minería de datos, para qué
sirve la minería de datos y cómo nos
podemos beneficiar de ella en el mundo
actual. Así que
comencemos. Bueno, antes de comenzar
vamos a dar una pequeña
introducción. Este, en el mundo actual
podemos decir que tenemos información
por todas partes. Esta información surge
de muchos datos. Eh, sin embargo, tener
datos y tener a posterior información,
información no implica tener
conocimiento. Eh, podemos tener muchos
datos, pero esto no no nos hace
conocedores de un tema. Entonces, ¿qué
hacer para lograr conocimiento? Bueno,
lo que se hace generalmente es aplicar
varios procesos a los datos con el fin
de obtener algo valioso, en este
caso, eh,
conocimiento. La minería de datos es uno
de estos métodos que se aplican a los
datos para poder obtener ese algo
valioso que es el conocimiento. La
minería de datos lo que hace es generar
conocimiento. Con eso podemos comenzar a
trabajar esta con esa premisa podemos
comenzar a trabajar esta exposición.
Antes de entrar a lo que es la minería
de datos en sí, debemos tocar un tema
muy importante relacionado con la
minería de datos, que es el KDD. KDD son
las siglas en inglés de knowledge,
discovery databases. Eso es la búsqueda
de descubrimiento en bases de datos.
¿Qué es el KDD?
Bueno, el KDD se puede decir que es un
proceso en el cual se identifican
patrones
útiles en los datos para obtener
posteriormente conocimiento útil, válido
y
relevante. Eh, el conocimiento que se
que resulta debe ser presentado de
manera clara y comprensible, ya que de
esta manera se puede decir que el
trabajo fue un éxito, el trabajo de
generar conocimiento. Por eso tenemos
este esquema de datos y de esos datos lo
que hacemos es identificar patrones
útiles. Antes de de adentrarnos a lo que
es el proceso en sí del KDD, es
necesario eh que veamos un tema que
forma parte del proceso del KDD, que son
los almacenes de datos o data warehouse,
como lo dice su nombre en inglés. ¿Qué
es el eh el almacén de datos? es una
colección de datos de varias fuentes que
están almacenados bajo un esquema
unitario. Eh, usualmente este esquema
unitario reside o este almacén de datos,
perdón, reside en un único lugar. Como
podemos apreciar en esta
imagen, eh
los tenemos tres bases de datos en este
ejemplo, por ejemplo, en esta imagen,
las dos rojas y esa amarilla. Lo que
hacemos es de esas tres bases de datos
que pueden estar
ubicadas en distintos puntos
geográficos, lo que hacemos es almacenar
los datos relativos al estudio que yo
voy a realizar o los datos importantes
de esas distintas bases de datos en un
almacén que es representado por la por
el símbolo azul. Ese es el almacén de
los datos. Entonces, ¿de qué me
beneficio yo teniendo un almacén de
datos? Bueno, de que lo que me tomaría
mucho tiempo y recursos a la hora de
trabajar con distintas bases de datos
separadas, inclusivamente
geográficamente, lo voy a lo a ganar,
voy a a ganar tiempo y ahorrarme
recursos si yo trabajo solamente con un
almacén de datos donde se encuentren los
datos relativos o a mi a mi análisis, al
trabajo que estoy realizando, ya que los
voy a encontrar en un único en un único
lugar.
Vamos, ahora sí, una vez visto qué es el
almacén de datos, vamos a ver cómo se
usa este almacén de datos o qué parte en
en qué
parte se es relativo en el proceso del
KDD. En esta imagen podemos ver que el
proceso del KDD en general, el KDD
comienza con eh datos, ¿verdad? Esa es
la fuente del análisis de KDD.
Posteriormente de esos datos se hace una
selección de datos que es almacenada en
el almacén de datos. Ahí donde
donde entra el almacén de datos en el
proceso del KDD. Luego eh los datos que
están en el en el almacén son
procesados, posteriormente transformados
y esas datos transformados son los que
van a hacer a servir de entrada al
proceso de minería de datos y la salida
de la minería de datos va a ser
patrones. Entonces, ¿qué qué es lo
importante de notar aquí? que la minería
de datos forma parte del proceso de KDD
y es una parte sumamente importante en
el proceso de de búsqueda de información
en bases de datos, ya que la la minería
de datos es lo que va a generar el
patrón que va a ser evaluado e
interpretado para generar como paso
final y resultado es
conocimiento. Eh, ¿para qué se usa el
KDD? Bueno, ya se mencionó más o menos
en el en el proceso, como se dijo, el KD
lo que hace es procesar, se usa para
procesar grandes cantidades de datos,
para identificar patrones relevantes en
estos datos y para
generar al final resultados que serán
convertidos en
conocimiento. Eso es de forma básica que
es el KDD o la búsqueda de
descubrimiento, el descubrimiento de
conocimiento en bases de datos. Ahora sí
podemos entrar a qué es la minería de
datos en sí. Podemos decir que la
minería de datos eh como concepto es son
o son distintos procesos y métodos
cualitativos en donde trabajamos con
grandes cantidades de datos haciendo uso
o ayudándonos de herramientas como lo
son las bases de datos, como son
herramientas y procesos estocásticos,
estadísticos y también eh ayudándonos de
sistemas y programas computacionales
para generar información. La información
es lo que se busca generar con un
proceso o al llevar a cabo un proceso de
minería de datos. Eh, usando todas estas
herramientas que mencioné y más entre
estas son algunas de las herramientas
que se pueden utilizar, vamos a sacar
información oculta en los datos y al
obtener esta información oculta en los
datos, entre comillas ocultas, ya que eh
se dice oculta porque está inmersa en
una gran cantidad de datos, vamos a
obtener como como resultado final
información. Esta información al ser
analizada y estudiada me va a generar
conocimiento. Eso es en básicamente lo
que lo que es la minería de
datos. Pero para verlo de una manera tal
vez más gráfica y más mucho más
comprensible, podemos imaginarnos esta
montaña de datos. Esta montaña está
compuesta por muchos datos, ¿verdad?
Podemos tener datos como, por ejemplo,
nombre de una persona, dirección, eh
trabajos, eh muchos muchos aspectos.
cualquier cantidad de aspectos que sean
que sean de interés para un trabajo.
Estos son los datos con los que vamos a
trabajar o los que existen en esta gran
montaña. También podemos tener en esta
montaña conjunta de datos datos del tipo
numérico, eh como por ejemplo la edad,
el peso de una persona, la temperatura
de un lugar,
eh los niveles de inflación, en fin, un
gran cantidad de ¿qué? De datos. Esta
montaña está compuesta de datos, datos,
datos y más datos. Ahora, ¿qué se desea
lograr o producir con estos datos? La
minería de datos lo que busca producir
es información. Como hemos dicho varias
veces, con esa gran cantidad de datos lo
que queremos hacer es tomar, en este
caso, viendo la montaña, es solo la
punta, es solo un trozo de esos datos,
estudiarlos, llevarlos por ciertos
métodos y procesos para generar al
final.
Entonces, espero que de esta manera se
pueda observar mejor o tal vez tendré
una mejor idea de lo que la minería, de
qué es la minería de datos. Y bueno,
ahora lo que vamos a pasar a
continuación es ver los métodos en los
cuales con los cuales nos hacemos uso
para poder generar esa información.
Entre los métodos de la minería de datos
tenemos lo que es la clasificación, el
clustering, la asociación, entre otros,
ya que podemos tener muchos más métodos,
pero bueno, yo voy a mencionar estos
tres que tal vez sean los más utilizados
y específicamente vamos a adentrarnos en
lo que es el método de de clustering.
Clustering o cluster, eh se puede decir
que es una técnica de análisis de datos
donde buscamos resolver un problema de
clasificación.
El objetivo que se tiene con el
clustering es eh ordenar datos en grupos
de forma que el nivel de asociación o
nivel de similitud entre ellos sea
fuerte. Esto lo podemos entender mejor
tal vez viendo este este
gráfico. En este gráfico cada punto
representa un dato por separado.
Entonces, ¿qué hacemos en el proceso de
clustering? Es agruparlos aquellos datos
que tengan un nivel de similitud o de
asociación fuerte entre ellos. En este
caso tenemos a partir de todos los los
datos, de todos los puntos que
representan datos, generamos tres
clusters, el rojo, el azul y el verde.
Eh, de esta. ¿Para qué hacemos esto?
Bueno, porque trabajar con tres grupos
grandes de datos es más sencillo que
trabajar con cada dato individual, cada
punto que se encuentra en este gráfico
que representa un dato individualmente.
Esto nos ahorra trabajo y reduce tal vez
el nivel de error que pueda existir el
momento de trabajar con grandes
cantidades de datos. Vamos a ver ahora
de manera global las clasificaciones del
clustering y los métodos. Tenemos entre
las clasificaciones tenemos la
jerárquica y la no jerárquica. La
clasificación jerárquica de manera
general es aquella clasificación que eh
donde la clasificación resultante tiene
un creciente, un un número creciente de
clases anidadas, mientras que la no
jerárquica, la clasificación que hacemos
no es anidada. Esto se puede investigar
más adelante con más detalle. Aquí
simplemente lo estoy mencionando para
tener una idea de las clasificaciones
del clustering. En cuanto a los métodos
tenemos el los aglomerados y los
divisivos. Los aglomerados eh son
aquellas donde tenemos vamos a tener
tantas clases como objetos se tengan que
clasificar, mientras que los divisivos
es donde se vamos a partir o si partimos
de una clase formada por todos los
objetos que se van dividiendo en las
clases sucesivamente. Esto como dije
anteriormente, simplemente para
mencionar eh una manera de definición
rápida de qué son de cuáles son las
clasificaciones y los métodos, pero si
se quiere investigar esto más a fondo,
pues eh los invito a buscar por su
propia cuenta. Esto es más general.
Bueno, entonces de esta manera vimos eh
los métodos de la minería de datos, pero
como mencioné al comienzo, antes de
entrarnos en el clustering, existen
otros métodos de la minería de datos,
otros métodos que nos logran o nos
permiten generar a partir de los datos
el objetivo final, que es la
información. Eh, vamos ahora a ver las
fases de la minería de datos. En
general, podemos nombrar cinco fases
importantes que se llevan a cabo en un
proceso de minería de datos.
La primera de ellas es la selección. La
selección, como lo dice su nombre, es
seleccionar de los datos, fuentes,
aquellos que son adecuados a nuestro
problema. Eh, si no partimos de una
buena selección de datos, entonces lo
más seguro es que nuestro resultado
final sea malo o tenga algún error.
Siempre es importante hacer una
selección adecuada de los datos para
poder pasar al siguiente paso o fase,
que es el de preprocesamiento. Este paso
es muy importante en lo que es la
minería de datos, ya que el
preprocesamiento es en consiste en
preparar previamente los datos que se
fuer que fueron seleccionados para
evitar para evitar que en un futuro o en
el proceso de trabajar con ellos existan
anomalías, evitar que existan fallas o
inconsistencias o cualquier otro aspecto
que a la larga puedan producir
resultados pobres e incorrectos. Este,
¿por qué es importante hacer esto?
Bueno, porque se eh de esta manera al
preprocesar los datos vamos a eliminar y
corregir anomalías que existan en los
datos y que puedan generar posiblemente
resultados con mala calidad. Entonces,
al yo realizar el el preprocesamiento,
lo que voy a hacer es eh no no voy a
asegurar que mis resultados sean buenos,
pero por lo menos tengo mayor
probabilidad de que los resultados que
yo genere con el proceso de minería de
datos tengan mayor calidad y me permitan
tomar decisiones con mayor calidad. Por
ende, este, ¿cómo se lleva a cabo este
este procedimiento de o este paso de del
preprocesamiento de los datos? Bueno,
podemos nombrar la limpieza de datos,
que consiste en en rutinas donde vamos a
llenar datos vacíos. Yo puedo tener una
gran base de datos con en donde existan
datos vacíos o que o que tengan errores.
Entonces, lo que se busca hacer aquí es
llenarlos, identificar los errores y y
corregir estas
inconsistencias. Luego pasamos a lo que
es la integración de los datos. La
integración de los datos es donde vamos
a combinar datos de múltiples fuentes
para formar datos más coherentes. Luego
pasamos a la
transformación, que es donde vamos a
convertir los datos a formas más
apropiadas para trabajar en la minería
de datos. Y por último, pasamos a lo que
es la reducción. La reducción es donde
voy a obtener una representación más
reducida de los datos de manera que
pueda
minimizar la pérdida del contenido de la
información.
Esto es básicamente que es la el
procesami el preprocesamiento de los
datos y para qué sirve. Luego pasamos al
a la fase tres, que es el de la
selección de las variables. La selección
de las variables consiste en elegir los
mejores atributos del problema y buscar
variables independientes mediante
diversos test de sensibilidad. Esta
selección de variables es lo que me va a
poder lo que me permite generar eh
patrones que son los usados para hacer
modelos que son los usados en el paso
cuatro conocido como la extracción del
conocimiento, que es donde a partir de
los patrones que generé en el paso
anterior con las variables
independientes, eh voy a a poder generar
un modelo que es el que me va a
representar el comportamiento de los
valores del problema. Este modelo es el
que voy a usar en el paso final, que es
la interpretación, para poder sacar
conclusiones válidas. Al yo analizar y
estudiar el modelo generado con a partir
de todos los pasos anteriores, lo que
voy a poder es generar conclusiones
válidas que me van a generar al final
conocimiento, qué es lo que información
y conocimiento, qué es lo que se busca.
Hemos dicho que se busca con la minería
de datos. Entonces, bueno, estas son las
en esto consisten las fases de la
minería de datos. Ahora vamos a pasar
una vez hablado de qué es la minería de
datos, las fases y los métodos que son
ligados a ella, vamos a hablar de las
aplicaciones. ¿En qué podemos usar la
minería de datos en el mundo actual?
Bueno, la tengo que comenzar diciendo
que la minería de datos se aplica a
muchísimas cosas. Eh, en el mundo actual
tenemos estamos rodeados de información
y de datos. Entonces, la minería de
datos va a tener vida y va a tener
oportunidades de
desarrollarse de muchísimas y diversas
formas. Bueno, yo menciono aquí algunas
como es el el marketing, eh la trabajo
de universidades, por ejemplo, eh en los
negocios es muy usada en trabajos de
predicción, en control de calidad, por
ejemplo, y en el web mining, que vamos a
entrar en él un poquito más adelante.
Este vamos a centrarnos en qué en en qué
sirve aplicar la minería de datos al
marketing, por ejemplo. Bueno,
muchísimas compañías tanto de calzados,
de tecnología, de ropa, cualquier
compañía grande o pequeña se ve
beneficiada de la minería de datos, ya
que ellos les interesa saber tres
preguntas básicas. ¿Quién va a comprar?
¿Dónde va a comprar? ¿Y cuándo van a
comprar?
Eh, estos tres preguntas, la respuesta
me las da la minería de datos, ya que
todas estas compañías tienen grandes
bases de datos eh donde se refleja el
comportamiento de sus clientes. Con
estos datos, con estas grandes bases de
datos, al aplicar el proceso de minería
de datos, yo puedo eh indicar quién va a
comprar el producto, cuándo lo va a
comprar, dónde lo va a comprar, dónde es
mejor invertir dinero en publicidad, en
qué producto es mejor invertir dinero, a
qué sector demográfico es mejor invertir
este dinero, que es lo que les importa a
estas grandes compañías, tanto ahorrar
dinero en en el proceso de de llevar a
cabo estos análisis del consumidor como
ganar dinero. Eso es lo lo que más les
importa a estas compañías al final,
ganar
dinero dando buenos productos a a sus
clientes. Bueno, ahora vamos a entrar en
un en una aplicación muy importante,
considero yo, muy importante
actualmente, que es el web mining, ya
que como sabemos el el actualmente la el
boom web es enorme. muchísima cantidad
de personas están entrando a páginas
web. El tráfico web en los últimos años,
el acceso a internet en los últimos años
ha crecido exponencialmente. Entonces,
¿cómo podemos aplicar la minería de
datos en la web? Bueno, como menciono yo
aquí, estas cinco páginas web Amazon,
Facebook, YouTube, Google y Twitter, son
grandes páginas web, grandes redes
sociales también que han tenido o tienen
o acaparan tal vez la mayor cantidad de
tráfico de usuarios web en la
actualidad. Estas páginas, como también
lo hacen las compañías que mencioné
antes, estas páginas tienen bases de
datos donde almacenan el comportamiento
del usuario web en su página desde el
momento en que entra en la página hasta
el momento en que sale. ¿A qué se dirige
apenas entra a la página? ¿Qué le qué
enlaces usa primero? ¿Qué enlaces no
usa? Si la persona es hombre, ¿en qué se
mete? Si la persona es mujer, ¿en qué
parte se mete de la página? Todo eso
ellos lo van almacenando y al llevar a
cabo un proceso de minería de datos
pueden atraer más personas, mantener a
los que ya tienen y generar cosas
nuevas, saber qué cosas nuevas, qué
podrían, qué innovaciones podrían
implementar en sus páginas web para
mantener el tráfico que tienen y generar
mucho más de esta manera ellos
beneficiarse.
Entonces, pues de esta manera podemos
ver que las aplicaciones en la minería
de la minería de datos es muy extensa y
se puede aplicar en muchas otras cosas
que tampoco he mencionado aquí, pero ya
ustedes deberían tener una idea de que
de todo el campo, el gran campo de
trabajo que tiene la la minería de
datos. Con esto, esto nos lleva a
nuestras ya conclusiones. Una vez visto
toda esta exposición de temas y de
aspectos importantes relativos a la
minería de datos, podemos decir o como
dije en varias veces que actualmente en
nuestro día a día tenemos grandes
cantidades de datos que son descargadas
a nuestro alrededor. Nosotros también
descargamos informaciones de y datos
desde el momento en que pasamos una
tarjeta para comprar algo o cuando nos
acercamos a una tienda porque nos gusta
un producto y lo estamos detallando. Eh,
todo esos son datos que las compañías y
que están que están siendo descargados a
nuestro alrededor. Nosotros descargamos
datos y datos son descargados de
nosotros. Entonces, eh donde hay datos
hay información. donde información se
quiere buscar conocimiento. Y y ¿cómo se
busca este conocimiento? Bueno, hemos
dicho que con la minería de datos. Por
lo tanto, donde hay información tenemos
minería de datos y actualmente la
información va creciendo, por lo tanto,
la minería de datos va creciendo de mano
de la mano de la información. También es
allí donde podemos decir que la minería
de datos va a seguir creciendo a lo
largo de estos años, eh va a seguir
avanzando y desarrollándose. Es un campo
de estudio de bastante trabajo y
bastante beneficio para las personas que
se meten en este en este
campo. Bueno, de esta manera espero eh o
de esta manera terminamos esta
exposición, esta presentación. Espero
que que les haya gustado, que hayan
entendido y que hayan comprendido
básicamente en qué consiste la minería
de datos, que tengan una idea de qué es
la minería de datos, de para qué me
sirve y cómo la puedo usar en un futuro.
Así que bueno, muchas gracias y hasta la
próxima. Yeah.
Continúa con YouTLDR
Analiza otro video con Pro
Procesa un video nuevo, busca cada marca de tiempo, compara fuentes y guarda el resultado en tu biblioteca.
More transcripts
Explore other videos transcribed with YouTLDR.

Leilão de Embriões Nelore PO DNA Genética Aditiva
LANCE RURAL OFICIAL · Portuguese (Portugal, Brazil)

Leilão Peso Pesado Rima Agropecuária
LANCE RURAL OFICIAL · Portuguese (Portugal, Brazil)

النبي .. جبران خليل جبران .. إقرا بودانك
اقرا بودانك · Arabic

Leilão Internacional CIA
LANCE RURAL OFICIAL · Portuguese (Portugal, Brazil)

23° Mega Leilão Genética Aditiva - 1ª Etapa Fêmeas Nelore PO
LANCE RURAL OFICIAL · Portuguese (Portugal, Brazil)

كتاب رسالة الغفران
كتابي المنقذ · Arabic

Erkenntnistheorie 7 Immanuel Kant II
Dominik Finkelde - Hochschule f. Philosophie · English

Schwarze Löcher Erklärt - Von der Geburt bis zum Tod
Dinge Erklärt – Kurzgesagt · German

Como construir uma esfera de Dyson – A Megaestrutura Suprema
Em Poucas Palavras – Kurzgesagt · Portuguese (Portugal, Brazil)

[Histoire des sciences] L’histoire de l’intelligence artificielle (IA)
CEA · French

ميكانيكا الكم│1│الواقع الوهمى - كيف بدأ الكم ؟!
Sharafestien - شرفشتــاين (Sharafestien) · Arabic

Mi niñez fue un fusil AK-47
Comisión de la Verdad · Spanish