NovaMind desarrolló un motor de detección de anomalías capaz de procesar flujos de datos en tiempo real con latencia sub-100ms. El proyecto implicó investigar arquitecturas de modelos híbridos que combinan métodos estadísticos clásicos con redes neuronales, enfrentando incertidumbres sobre la adaptación al concept drift en producción.
Crear un sistema de detección de anomalías que supere las limitaciones de los enfoques batch tradicionales, logrando precisión superior al 92% con tasa de falsos positivos menor al 3%, y capaz de adaptarse dinámicamente a cambios en la distribución de datos sin re-entrenamiento completo.
- Baseline con Isolation Forest puro (PR #124, #131) — latencia 180ms, inaceptable
- LSTM-AE con ventana deslizante de 50 timesteps (PR #145, #163) — pérdida de señal en anomalías cortas
- Ensemble híbrido con gate neuronal para selección dinámica de modelo (PR #192, #210)
- IF puro: recall 78%, latencia inviable para producción
- LSTM-AE puro: recall 89% pero 340ms de latencia media
- Ensemble híbrido: recall 93.4%, latencia P99 de 67ms — avance técnico confirmado
- ADWIN sobre residuales del modelo: falsos positivos excesivos (PR #229, #247)
- Ventana dual con KL-divergence como señal de drift (PR #265)
- Detector de drift basado en embeddings del LSTM (investigación Notion doc)
- ADWIN: 23% tasa de falsa alarma inaceptable en datos reales
- KL-divergence: reducción a 8% de falsas alarmas, pero latencia de detección alta
- Embedding-based drift: 4.1% falsa alarma, detección en <30s — solución adoptada
| Nombre | Rol | % Tiempo anual | Dedicación |
|---|---|---|---|
| Dr. Priya Mehta | Lead ML Engineer |
60%
|
Diseño arquitectura, experimentación principal |
| Carlos Vega | Senior Data Scientist |
45%
|
Experimentos drift detection, evaluación |
| Aisha Kamara | MLOps Engineer |
25%
|
Infraestructura de streaming, integración producción |
Desarrollo de un pipeline capaz de integrar datos estructurados de 15+ fuentes heterogéneas (SQL, NoSQL, APIs REST, archivos CSV/Parquet) con reconciliación automática de esquemas en conflicto. El proyecto abordó el problema no resuelto de alineación semántica entre entidades de negocio con nomenclaturas distintas.
Eliminar el proceso manual de mapping entre fuentes (estimado en 40h/semana de ingeniería), desarrollando un sistema de inferencia semántica que detecte y resuelva automáticamente conflictos de esquema con precisión superior al 95%, aplicable a nuevas fuentes sin configuración manual.
- Comparación de TF-IDF edit-distance vs sentence-transformers en 2.400 pares de campos (PR #55, #67)
- Fine-tuning de modelo en dataset propietario de 800 mappings históricos (PR #78)
- Ensemble con reglas heurísticas para casos de alta ambigüedad (PR #89)
- TF-IDF: 71% precisión — insuficiente para automatización completa
- Sentence transformers pre-entrenados: 84% — mejora significativa pero con fallos en acrónimos
- Modelo fine-tuned + heurísticas: 96.3% precisión en test set — objetivo alcanzado
| Nombre | Rol | % Tiempo anual | Dedicación |
|---|---|---|---|
| Min-Ji Park | Data Engineer Lead |
55%
|
Diseño pipeline, experimentos semánticos |
| Raj Patel | NLP Researcher |
35%
|
Fine-tuning modelo, evaluación embeddings |
Investigación y desarrollo de un módulo de explicabilidad (XAI) nativo para los modelos de ML de NovaMind, capaz de generar explicaciones locales y globales en tiempo real. El trabajo requirió resolver incertidumbres sobre la aplicabilidad de SHAP/LIME en modelos de ensemble con alta cardinalidad de features.
Proporcionar explicaciones comprensibles para clientes regulados (finanzas, salud) cumpliendo con requisitos de auditoría, con tiempo de generación de explicación menor a 200ms por predicción y fidelidad superior al 90% respecto al modelo original.
- SHAP TreeExplainer sobre el ensemble: tiempo 4.2s por muestra — inviable (PR #10)
- LIME con muestreo local de 100 perturbaciones (PR #22) — fidelidad 71%
- Kernel SHAP aproximado con coaliciones reducidas (PR #38) — fidelidad 88%, 180ms
- Explicaciones contrafactuales como complemento (PR #51, Notion doc)
- SHAP completo: imposible en producción por latencia
- LIME: fidelidad insuficiente para auditorías regulatorias
- Kernel SHAP optimizado: 91.2% fidelidad, 178ms P95 — solución viable
- Contrafactuales mejoran comprensión del usuario final en test con clientes
- DiCE model-agnostic con búsqueda aleatoria (PR #51) — demasiado lento, 8s/muestra
- Búsqueda genética con restricciones de plausibilidad (Notion doc prototipos)
- Nearest-neighbor en espacio latente del LSTM-AE como punto de partida (PR #38)
- Búsqueda aleatoria: impracticable en espacio de alta dimensión
- Algoritmo genético: 94% de contrafactuales válidos en 1.1s media
- Combinación NN-latent + genético: 97% validez, 0.6s — avance técnico documentado
| Nombre | Rol | % Tiempo anual | Dedicación |
|---|---|---|---|
| Dr. Priya Mehta | Lead ML Engineer |
30%
|
Dirección investigación XAI, revisión técnica |
| Fatima Al-Rashid | ML Researcher (XAI) |
70%
|
Implementación SHAP/LIME/contrafactuales, todos los experimentos |
| Thomas Bouchard | Backend Engineer |
20%
|
Integración API, optimización de latencia |