Repaso para el examen AWS Certified AI Practitioner. Conceptos base de IA/ML, ciclo de vida, servicios de AWS y métricas de clasificación y regresión.
Elimina primero los dos distractores obvios. "Menor esfuerzo operativo" o "sin administrar infraestructura" apunta a un servicio administrado (Textract, Bedrock...).
| Término | Qué es | Ejemplo |
|---|---|---|
| Inteligencia Artificial (IA) | Sistemas que imitan capacidades humanas: razonar, aprender, decidir. | Asistente virtual, detección de fraude. |
| Machine Learning (ML) | Subconjunto de IA: el modelo aprende patrones de los datos, sin reglas escritas a mano. | Predecir el precio de una casa. |
| Deep Learning (DL) | ML con redes neuronales de muchas capas — muy bueno con imágenes, audio y texto. | Reconocer rostros en fotos. |
| Red neuronal | Capas de nodos conectados que transforman la entrada en una predicción. | Base de todo el deep learning. |
| NLP / Computer Vision | Ramas de la IA: entender lenguaje humano / interpretar imágenes y video. | Comprehend (NLP) · Rekognition (CV). |
IA ⊃ ML ⊃ Deep Learning ⊃ IA Generativa. Cada nivel es un subconjunto del anterior.
| Tipo | Datos | Tareas típicas |
|---|---|---|
| Supervisado | Etiquetados (se conoce la respuesta correcta). | Clasificación (fraude sí/no) y regresión (precio). |
| No supervisado | Sin etiquetas — el modelo busca estructura solo. | Clustering (segmentar clientes), detección de anomalías. |
| Por refuerzo | Sin dataset: un agente prueba acciones y recibe recompensas. | Robótica, juegos, RLHF en LLMs. |
| Semi / auto-supervisado | Pocas etiquetas + muchos datos sin etiquetar. | Preentrenamiento de los LLMs. |
Estructurados: tabulares y series de tiempo. No estructurados: texto, imagen, audio y video. Etiquetado = tiene la "respuesta" incluida.
| Caso | Qué pasa | Síntoma | Cómo se corrige |
|---|---|---|---|
| Underfitting | Modelo demasiado simple — no captura el patrón (alto bias). | Mal en entrenamiento y en prueba. | Modelo más complejo, más features, entrenar más. |
| Overfitting | Memoriza el entrenamiento, incluido el ruido (alta varianza). | Excelente en entrenamiento, malo con datos nuevos. | Más datos, regularización, early stopping, modelo más simple. |
| Buen ajuste | Aprende el patrón general. | Rendimiento similar en entrenamiento y prueba. | — |
Buen resultado en train pero malo en test = overfitting. Malo en ambos = underfitting. Bias alto ↔ underfitting; varianza alta ↔ overfitting.
| Modo | Cuándo | Latencia |
|---|---|---|
| Real-time | Predicción inmediata, una a una — endpoint siempre activo. | Milisegundos |
| Batch | Procesar lotes grandes de una vez, sin endpoint permanente (SageMaker Batch Transform). | Horas a días (offline) |
| Asincrónica | Payloads grandes o procesos de hasta ~1 hora: se encolan y el resultado llega después. | Minutos (hasta 1 h) |
| Serverless | Tráfico intermitente: pagas solo por uso, sin gestionar capacidad. | Variable (cold start) |
Chatbot o fraude en el momento = real-time. Reporte nocturno de miles de registros = batch. Orden de latencia: real-time < asincrónica < batch.
| Necesitas | Usa esto (específico) | Evita esto (genérico) |
|---|---|---|
| Extraer texto de PDF/imagen | Textract | Entrenar OCR en SageMaker |
| Análisis de sentimiento / NLP | Comprehend | Entrenar un clasificador NLP propio |
| Voz → texto / texto → voz | Transcribe / Polly | Modelo propio de speech-to-text |
| Reconocimiento de imágenes/video | Rekognition | Entrenar un modelo de visión propio |
| Traducción | Translate | — |
| Preguntas sobre tus documentos (LLM) | Bedrock Knowledge Bases | Armar tú mismo el pipeline de RAG |
Si existe un servicio de AWS que resuelve el caso "out of the box", esa es la respuesta correcta — aunque construirlo tú mismo con SageMaker también sea técnicamente posible. Lo específico gana por costo y velocidad.
| Necesitas | Servicio |
|---|---|
| Búsqueda inteligente sobre documentos de la empresa | Amazon Kendra |
| Recomendaciones personalizadas (productos, contenido) | Amazon Personalize |
| Chatbots conversacionales de voz y texto | Amazon Lex |
| Extraer entidades de texto clínico | Comprehend Medical |
| Revisión humana de predicciones de baja confianza | Amazon A2I |
| Asistente de IA generativa para empresa / desarrolladores | Amazon Q |
| Necesitas | Servicio / feature | Clave |
|---|---|---|
| Clasificar imágenes en tus propias categorías | Rekognition Custom Labels | Requiere imágenes etiquetadas por categoría. |
| Clasificar texto o detectar entidades propias | Comprehend custom models | Requiere datos de entrenamiento etiquetados. |
| Transcribir jerga, marcas o acrónimos del negocio | Transcribe custom vocabulary / custom language model | Mejora la precisión en habla de dominio. |
| Detectar el idioma del audio | Transcribe language identification | Solo identifica el idioma; no mejora la jerga. |
| Traducir con términos propios | Translate custom terminology | Fija cómo se traducen marcas y términos. |
| Crear un bot conversacional | Amazon Lex | Conversa; no sirve para afinar transcripciones. |
Entrenar un modelo personalizado exige datos etiquetados: sin etiquetas no hay aprendizaje supervisado. Sin etiquetas, lo típico es clustering (no supervisado).
| Predicho: Positivo | Predicho: Negativo | |
|---|---|---|
| Real: Positivo | TP — True Positive | FN — False Negative |
| Real: Negativo | FP — False Positive | TN — True Negative |
Solo para modelos con variable objetivo discreta — típicamente binaria (Sí/No, Fraude/No fraude). Los modelos de regresión (MAE, RMSE, más adelante) predicen una variable continua (precio, monto, demanda) y no usan esta matriz. FP = Error Tipo I · FN = Error Tipo II.
| Métrica | En una frase |
|---|---|
| Recall | De los casos reales positivos, ¿cuántos lograste detectar? |
| Precision | De lo que proyectaste como positivo, ¿cuántos son realmente positivos? |
| Accuracy | De todas tus predicciones, ¿cuántas acertaste? |
| F1-score | ¿Qué tan equilibrado está el modelo entre precision y recall? |
Guarda esta intuición: Recall mira hacia los reales, Precision mira hacia lo predicho, Accuracy mira el total. Las fórmulas de las próximas slides son solo la forma exacta de calcular cada una.
| Concepto | Qué es |
|---|---|
| Curva ROC | Recall (TPR) vs. tasa de falsos positivos (FPR), al variar el umbral de decisión. |
| AUC | Área bajo la curva, de 0 a 1: resume qué tan bien separa las clases. |
| Lectura | 0.5 = azar · 1.0 = perfecto · más área = mejor modelo. |
| Cuándo usarla | Comparar clasificadores sin fijar un umbral específico. |
Separar bien las clases en todos los umbrales = AUC-ROC.
Un banco entrena un modelo para predecir si una transacción de compra por internet es fraudulenta (Sí/No). Se evalúan 1,000 transacciones, de las cuales 50 son realmente fraudulentas (5%).
| Predicho: Fraude | Predicho: No fraude | |
|---|---|---|
| Real: Fraude (50) | TP = 40 | FN = 10 |
| Real: No fraude (950) | FP = 60 | TN = 890 |
93% de accuracy suena excelente, pero de las 100 transacciones que el modelo marcó como fraude, 60 eran en realidad legítimas (precision 40%). Por eso en fraude no se optimiza accuracy — se prioriza recall, aceptando más falsas alarmas a cambio de no dejar pasar fraude real.
| Escenario | Métrica | Por qué |
|---|---|---|
| Fraude / diagnóstico médico grave | Recall | No puedes dejar pasar un positivo real — el falso negativo es carísimo. |
| Spam / marketing | Precision | Una falsa alarma molesta más que dejar pasar un caso. |
| Desbalanceado, sin preferencia clara | F1-score | Balance robusto entre precision y recall. |
| Balanceado, errores cuestan igual | Accuracy | Simple y suficiente cuando no hay desbalance. |
Si RMSE es mucho mayor que MAE, hay errores puntuales muy grandes (outliers) en tus predicciones.
| Métrica | Problema | Qué mide | Outliers |
|---|---|---|---|
| RMSE | Regresión | Error, penaliza los grandes desproporcionadamente. | Muy sensible |
| MAE | Regresión | Error promedio, todos pesan igual. | Robusta |
| Accuracy | Clasificación | % de aciertos totales — engañosa si hay desbalance. | No aplica |
| Precision | Clasificación | Confiabilidad de lo marcado como positivo. | No aplica |
| Recall | Clasificación | Cobertura de los positivos reales. | No aplica |
| F1-score | Clasificación | Balance (media armónica) entre precision y recall. | No aplica |
| AUC-ROC | Clasificación | Qué tan bien separa las clases con cualquier umbral (0.5 = azar). | No aplica |
Siguiente bloque: Dominio 2 — Fundamentos de IA Generativa (LLMs, transformers, prompting). Repasa la tabla anterior antes del examen.
D3 y D2 suman 52% del examen: es donde más rinde estudiar. Datos sujetos a cambio — confirma en aws.amazon.com/certification.