P
prepair.app
Comenzar entrevista →
EnglishУкраїнськаРусскийDeutsch
🧠

Preguntas de entrevista de ingeniero de IA/ML

Las entrevistas de IA/ML mezclan dos cosas: la teoría clásica de machine learning — la que te preguntan en una pizarra — y el stack moderno construido alrededor de Python, PyTorch o TensorFlow, y cada vez más los transformers y los LLM. Aquí están las preguntas más frecuentes, cada una con una respuesta modelo.

Junior · sin experiencia / menos de 1 añoMiddle · 2–4 años de experienciaSenior · 5+ años de experiencia

Qué preguntan

Aprendizaje supervisado, no supervisado y por refuerzo
Evaluación de modelos y el trade-off bias-variance
Redes neuronales, backpropagation y optimización
Transformers, attention y fine-tuning de LLM
RAG, embeddings y bases de datos vectoriales
MLOps: serving, monitoreo y drift

9 preguntas reales con respuestas

Cada pregunta viene con una respuesta modelo con la que puedes comparar la tuya.

1

¿Cuál es la diferencia entre aprendizaje supervisado y no supervisado?

Respuesta

El aprendizaje supervisado entrena con ejemplos etiquetados — hay entradas y las salidas correctas, y el modelo aprende a mapear unas con otras, como en clasificación o regresión. El aprendizaje no supervisado no tiene etiquetas; busca estructura por sí solo, como en clustering o reducción de dimensionalidad. El aprendizaje por refuerzo es una tercera categoría donde un agente aprende de señales de recompensa producidas por sus propias acciones en lugar de un dataset fijo.

2

¿Qué es el overfitting y cómo se previene?

Respuesta

El overfitting ocurre cuando un modelo memoriza los datos de entrenamiento — incluido su ruido — en vez de aprender el patrón subyacente, así que rinde bien en entrenamiento y mal en datos nuevos. Se combate con regularización (L1/L2), dropout en redes neuronales, más datos de entrenamiento, early stopping, o simplemente un modelo más pequeño. El underfitting es el fallo opuesto: el modelo es demasiado simple para captar el patrón, y tanto entrenamiento como validación dan malos resultados.

3

¿Por qué dividir los datos en train, validation y test?

Respuesta

El conjunto de entrenamiento es de donde el modelo aprende. El conjunto de validación se usa durante el desarrollo para ajustar hiperparámetros y elegir entre modelos sin tocar el holdout real. El conjunto de test se toca exactamente una vez, al final, para reportar un número en el que se pueda confiar — si lo usas para ajustar, ese número deja de significar algo, un error que todavía se ve en pipelines reales.

4

¿Cuándo es accuracy la métrica equivocada, y qué se usa en su lugar?

Respuesta

Accuracy engaña en datos desbalanceados — un modelo que siempre predice "no es fraude" tiene 99% de accuracy en un dataset donde el 99% son transacciones legítimas, y es inútil. Precision indica cuántos de los positivos predichos eran realmente positivos; recall indica cuántos positivos reales se capturaron; F1 es su media armónica cuando se necesita un solo número. ROC-AUC es útil para comparar modelos en todos los umbrales a la vez, pero las curvas precision-recall son más honestas en clases muy desbalanceadas.

5

¿Qué es backpropagation?

Respuesta

Es el algoritmo que calcula cuánto contribuyó cada peso de una red neuronal al error, usando la regla de la cadena para propagar el gradiente de la loss hacia atrás desde la capa de salida hasta la de entrada. Cada peso se ajusta luego en la dirección que reduce la loss, escalado por el learning rate. No es magia — es cálculo aplicado de forma eficiente, reutilizando cálculos intermedios capa por capa en vez de recalcularlos desde cero.

6

¿Qué es el mecanismo de attention en un transformer?

Respuesta

Attention permite que cada token de una secuencia mire a todos los demás tokens y decida cuánto peso darles al construir su propia representación, en lugar de procesar la secuencia estrictamente en orden como hace un RNN. Self-attention calcula vectores query, key y value para cada token, y el producto punto de query y key da el peso de atención. Esto es lo que permite a los transformers modelar dependencias de largo alcance en paralelo, y es la razón principal por la que reemplazaron a los RNN en la mayoría de tareas de NLP.

7

¿Cuándo haces fine-tuning de un modelo en lugar de solo darle prompts?

Respuesta

El prompting — incluyendo ejemplos few-shot en el contexto — itera más rápido, no necesita infraestructura de entrenamiento, y funciona bien cuando la tarea está cerca de lo que el modelo base ya hace. El fine-tuning vale la pena cuando necesitas un formato de salida específico de forma confiable, cuando el vocabulario del dominio está lejos de los datos de entrenamiento generales, o cuando necesitas fijar un comportamiento que un prompt no puede garantizar de forma confiable. En la práctica, la mayoría de equipos prueba primero prompting y RAG, y solo hace fine-tuning cuando eso llega a un techo real.

8

¿Qué es RAG (retrieval-augmented generation) y para qué se usa?

Respuesta

RAG recupera documentos relevantes de una base de datos vectorial — normalmente por similitud de embeddings — y los mete en el prompt para que el modelo responda usando ese contexto fundamentado en vez de solo sus datos de entrenamiento. Es la solución estándar contra las alucinaciones en conocimiento específico de dominio o que cambia rápido, porque actualizar el índice es mucho más barato que reentrenar el modelo. El trade-off es que la calidad de la respuesta ahora depende mucho de la calidad del retrieval: una mala estrategia de chunking o un índice de embeddings desactualizado produce silenciosamente malas respuestas.

9

¿Cómo monitoreas un modelo en producción, y qué es el data drift?

Respuesta

Se rastrean las distribuciones de predicciones, las distribuciones de features de entrada y los resultados reales eventuales cuando están disponibles, comparándolos con lo que el modelo vio durante el entrenamiento. El data drift ocurre cuando la distribución de entradas cambia con el tiempo — cambia el comportamiento de los usuarios, se abre un nuevo mercado, se recalibra un sensor — así que un modelo que era preciso al entrenarse deja de serlo poco a poco por razones que no tienen nada que ver con el modelo en sí. Detectarlo requiere monitorear las entradas, no solo esperar a que las métricas de accuracy se degraden visiblemente, porque para entonces el daño real ya ocurrió.

🦎

Leer respuestas no es suficiente

En una entrevista real hablas bajo presión. Cam hace estas mismas preguntas, evalúa cada respuesta y muestra exactamente qué mejorar.

Practicar entrevista de AI/ML Engineer →
Gratis · 3 entrevistas al mes

Vale la pena leer

Todos los artículos →

Otras especializaciones

🔍Manual QA🤖QA AutomationJava Backend🐍Python Backend🐘PHP Backend🦫Go Backend🟢Node.js Backend💎Ruby on Rails🟣.NET Backend Developer🔷C++🟨JavaScript⚛️React Frontend💚Vue Frontend🅰️Angular FrontendNext.js🍏iOS (Swift)🟩Android (Kotlin)📱React Native Developer⚙️DevOps / SRE🗄️Data Engineer📊Data Scientist📈Business Analyst🎯Product Manager📋Project Manager🎨UI/UX Designer📣Marketing🧑‍💼HR / Recruiter🤝Sales / Account Manager🎧Technical Support Engineer