Las seis fases de un proyecto típico
No todos los proyectos pasan por las seis fases. Si ya tienes datos limpios y un data warehouse, saltamos directamente a la fase tres. Si necesitas solo consultoría, trabajamos en sprints de dos semanas sin comprometerte a un proyecto largo. Dicho esto, la mayoría de nuestros clientes recorren este camino completo.
Descubrimiento
Empezamos con una videollamada de 30 minutos donde nos cuentas qué problema quieres resolver. No necesitas saber nada de machine learning para esta conversación: lo que nos interesa es entender tu operación. ¿Dónde pierdes dinero? ¿Qué decisión tomarías mejor si tuvieras un dato que hoy no tienes?
Después de la llamada, nuestro equipo revisa internamente si el problema se puede abordar con IA o si hay una solución más simple (a veces un dashboard bien diseñado resuelve el 80% del problema). En 48 horas te enviamos un documento de una página con nuestra evaluación inicial, el enfoque propuesto y una estimación de costo y tiempo.
Duración: 2-3 días. Costo: gratis.
Auditoría de datos
Antes de construir cualquier modelo necesitamos saber con qué contamos. Nos conectamos a tus fuentes de datos (bases SQL, archivos planos, APIs, hojas de cálculo) y generamos un informe de calidad: qué campos tienen valores faltantes, cuántos registros hay, si existen duplicados, y qué tan representativa es la muestra.
Este informe es tuyo, independientemente de si decides continuar con nosotros. Muchos clientes nos han dicho que la auditoría por sí sola les reveló problemas de datos que llevaban meses sin detectar. Un ejemplo concreto: una cadena de farmacias descubrió que el 17% de sus registros de inventario tenían fechas en formato inconsistente, lo que distorsionaba todos sus reportes mensuales.
Duración: 1-2 semanas. Entregable: informe de calidad de datos con recomendaciones.
Preparación y feature engineering
Con el informe de auditoría en mano, limpiamos y transformamos los datos. Esto incluye rellenar valores faltantes con métodos estadísticos apropiados (no simplemente promedios), normalizar formatos, eliminar outliers que sean errores de registro y crear nuevas variables derivadas que alimenten mejor al modelo.
El feature engineering es donde más experiencia sectorial se nota. Para un proyecto de predicción de demanda en retail, por ejemplo, creamos variables como "días hasta el próximo festivo", "temperatura promedio de la semana" y "si el producto estuvo en promoción los últimos 14 días". Estas variables no estaban en los datos originales del cliente, pero mejoraron la precisión del modelo en 12 puntos porcentuales.
Duración: 2-3 semanas. Entregable: dataset limpio y documentación de transformaciones.
Desarrollo del modelo
Aquí es donde entrenamos y evaluamos los algoritmos. Probamos varias arquitecturas (regresión, árboles de decisión, redes neuronales, modelos de series temporales) y comparamos su rendimiento con validación cruzada. No elegimos el modelo más sofisticado sino el que mejor equilibra precisión, velocidad de inferencia y facilidad de mantenimiento.
Te presentamos los resultados en una sesión de revisión donde mostramos las métricas clave (precisión, recall, F1-score, MAE, según el tipo de problema) y explicamos en lenguaje claro qué significa cada número para tu negocio. Si el modelo no alcanza el umbral de rendimiento que acordamos en la fase de descubrimiento, lo decimos abiertamente y proponemos alternativas.
Duración: 2-4 semanas. Entregable: modelo entrenado, informe de evaluación, sesión de revisión.
Despliegue e integración
El modelo pasa de un notebook de Jupyter a un servicio en producción. Lo empaquetamos como una API REST con Docker, lo desplegamos en tu infraestructura (AWS, GCP, Azure o servidor local) y lo conectamos a los sistemas que lo van a consumir: tu ERP, tu CRM, tu aplicación web o tu sistema de alertas.
Configuramos también el pipeline de CI/CD para que futuras actualizaciones del modelo se desplieguen de forma automática y sin interrupciones. Cada despliegue pasa por pruebas automatizadas que verifican que la precisión no haya degradado respecto a la versión anterior.
Duración: 1-2 semanas. Entregable: API en producción, documentación de integración, runbook operativo.
Monitoreo y mejora continua
Un modelo de machine learning no es un software estático. Los patrones en tus datos cambian con el tiempo: la demanda varía por estacionalidad, los clientes modifican su comportamiento, las regulaciones evolucionan. Si no monitoreas el modelo, su precisión se degrada sin que te des cuenta.
Instalamos un sistema de monitoreo que rastrea la distribución de los datos de entrada (data drift) y las métricas de rendimiento del modelo en producción. Cuando detectamos una caída, reentrenamos el modelo con datos recientes. Durante el primer año, este reentrenamiento está incluido en el contrato (hasta cuatro ciclos). Después del primer año, puedes contratar un plan de mantenimiento mensual o tu equipo puede hacerlo internamente con las herramientas y la capacitación que les dejamos.
Duración: continua. Entregable: dashboards de monitoreo, alertas automáticas, reentrenamientos trimestrales.
Preguntas frecuentes sobre el proceso
Un proyecto que pasa por las seis fases suele tomar entre 8 y 14 semanas desde la primera llamada hasta el modelo en producción. Los proyectos más rápidos que hemos hecho tomaron 5 semanas (un chatbot para una empresa con datos ya organizados). El más largo fue de 6 meses para un sistema de visión por computador con múltiples cámaras en una planta industrial.
No es requisito. Nos encargamos de todo el desarrollo y despliegue. Lo que sí necesitas es al menos una persona que entienda tu operación y pueda responder preguntas sobre los datos. Si tienes un equipo de datos, mejor: trabajamos codo a codo con ellos y les transferimos conocimiento para que mantengan el sistema después.
Es lo más común. La fase de auditoría y preparación existe precisamente para eso. Hemos trabajado con clientes que tenían datos en 14 hojas de Excel distintas, sin formato estándar y con campos en tres idiomas. La limpieza toma más tiempo, pero es posible. Lo que no podemos hacer es inventar datos que no existen: si necesitas predecir algo y no tienes registros históricos de esa variable, primero hay que empezar a recopilarlos.
Solo si tú lo autorizas explícitamente. Podemos trabajar con acceso remoto a tu infraestructura sin copiar datos a nuestros servidores. En proyectos donde necesitamos procesar datos fuera de tu red (por ejemplo, para usar GPUs en la nube), firmamos un acuerdo de confidencialidad y usamos cifrado en tránsito y en reposo.
Dividimos el pago en hitos ligados a entregables. Un esquema típico: 30% al firmar el contrato, 30% al entregar el modelo validado, 40% al completar el despliegue en producción. Para proyectos de consultoría cobramos por sprint de dos semanas. No pedimos pagos por adelantado de más de 90 días de trabajo.
Un ejemplo real paso a paso
Una distribuidora de alimentos en Barranquilla nos contactó porque perdía entre 8% y 12% de sus productos perecederos cada mes por exceso de inventario. Su equipo de compras hacía pedidos basándose en la experiencia del jefe de bodega, que llevaba 20 años en el puesto y "sentía" cuánto pedir.
En la auditoría descubrimos que tenían tres años de datos de ventas diarias por SKU, pero el 9% de los registros tenía errores de digitación. Limpiamos el dataset en dos semanas.
El modelo de series temporales que entrenamos (Prophet con variables exógenas de clima y calendario) redujo el desperdicio al 3.4% en el primer trimestre. El jefe de bodega sigue revisando las sugerencias del modelo cada mañana, pero ahora tiene un número concreto en lugar de una corazonada. El ROI del proyecto se alcanzó en el segundo mes.
¿Listo para empezar?
La llamada de descubrimiento es gratuita y sin compromiso. En 30 minutos te decimos si la IA puede resolver tu problema y cuánto costaría.
Agendar llamada