Ir al contenido
Datos para Todxs ofrece servicios de consultorías y capacitaciones. Bienvenidx. 

Machine learning

Dentro del mundo de los datos, el aprendizaje de máquina (machine learning, ML) es uno de los pilares para la integración de modelos estadísticos de manera aplicada a otras áreas del saber, como los negocios, o la investigación científica. Abajo les compartimos un resumen sobre los aspectos más importantes de esta valiosa herramienta.

En Datos para Todxs, el ML es parte de nuestro set de herramientas desde el 2019: clusterings para entender los patrones de individuos, buscadores, automatizaciones, forecasts, etc.

Consulte nuestro curso con certificado en Python y SQL para Machine learning.

¿Qué es el machine learning?


El machine learning (ML), aprendizaje de máquina, o aprendizaje automático, típicamente se trabaja como se ve un proyecto en el que:

  1. Exploramos y estudiamos una o varias series de datos.
  2. Según los datos, seleccionamos el modelo estadístico. 
  3. Entrenamos el modelo con una subserie de datos, llamada datos de entrenamiento. 
  4. Aplicamos el modelo para hacer predicciones en nuevos casos.

En el paso 3, el algoritmo de aprendizaje busca los valores de los parámetros del modelo que minimizan una función de costo). El paso 4 implica hacer una inferencia predictiva, con la esperanza de que el modelo generalice bien.

Aprendizaje supervisado

  • Mapeo de aprendizaje de variables de entrada a una variable de salida
  • Utiliza un conjunto de datos etiquetado
  • Pares de entrada-salida (características, etiquetas o valores objetivo)
  • El aprendizaje supervisado le indica al algoritmo la respuesta correcta
  • Clasificación, regresión, detección de anomalías, etc.
  • Ejemplos de aplicaciones:

    • Reconocimiento facial: Postura, iluminación, oclusión (gafas, barba), maquillaje, peinado
    • Reconocimiento de caracteres: Diferentes estilos de escritura
    • Reconocimiento de voz: Dependencia temporal
    • Diagnóstico médico: De los síntomas a las enfermedades
    • Biometría: Reconocimiento/autenticación mediante características físicas y/o de comportamiento: Rostro, iris, firma, etc.
    • Detección de valores atípicos/novedades
    • Predicción de películas
    • Predicción del precio de las acciones


Aprendizaje no supervisado

  • Aprender “lo que sucede normalmente”
  • Sin variable de salida
  • Agrupación: agrupar instancias similares
  • Aplicaciones de ejemplo:

    • Segmentación de clientes
    • Compresión de imagen: cuantificación de color
    • Bioinformática: motivos de aprendizaje 

Aprendizaje por refuerzo

  • Aprendizaje mediante la interacción con el entorno (ensayo y error)
  • Consiste en observar el estado del entorno, actuar y recibir una recompensa.
  • No hay un supervisor que indique la respuesta correcta.
  • Solo las recompensas relativas dan pistas sobre la calidad de la acción.
  • Ejemplos de aplicaciones:

    • Juegos (p. ej., Mario)
    • Búsqueda y rescate robótico
    • Planificación de rutas
    • Descubrimiento de fármacos

Estadística y cálculo detrás del ML


El aprendizaje a menudo se basa en minimizar las pérdidas esperadas. Esto se hace a través de la optimización de la función de pérdida (Loss function).

Función de pérdida


La pérdida es una medida del rendimiento del algoritmo, ya sea que esté aprendiendo un buen modelo o no. Depende de la aplicación.
En palabras simple, lo que hace esta función es considerar los casos de malas clasificaciones o malas predicciones. Lo cual, nos permite estimar la probabilidad de que el algoritmo haga una mala clasificación.


Clasificador Bayesiano

En problemas de dos clases, en los que contemos con variables con distribución conjunta, el "Clasificador Bayesiano" viene dado por:

f∗(x) = (1 si P(1|x) > 1/2,
0 en caso contrario.
Para cualquier clasificador f : X → {0, 1}, L(f∗) ≤ L(f )

El "Clasificador Bayesiano" es el clasificador "óptimo". Sin embargo, nunca podemos usar el Clasificador Bayesiano, ya que desconocemos la distribución condicional verdadera de los datos.