🍁 SR&ED — Scientific Research & Experimental Development

SRED Project Descriptions — FY 2025

NovaMind Analytics Inc. · Preparado con CULTIVA IA / Organizador SR&ED Skill
Empresa NovaMind Analytics Inc.
Año Fiscal 2025
Consultor CULTIVA IA
Fecha 14 Jun 2026
Programa CRA SR&ED
5
Proyectos analizados
3
Elegibles SR&ED
74
PRs revisados
12
Incertidumbres técnicas
~$240K
Crédito est. CAD
CULTIVA IA · Skill SR&ED Organizer v1.0
Clasificación de Proyectos
✅ Elegibles SR&ED (3)
🔬Motor de Detección de Anomalías en Tiempo Real
🔬Pipeline de Integración de Datos Multi-Fuente
🔬Módulo de Explicabilidad XAI para Modelos de ML
❌ No elegibles (2)
🖥️Rediseño del Dashboard UI (Frontend) — aplicación rutinaria de tecnologías conocidas, sin incertidumbre técnica
☁️Optimización de Infraestructura Cloud — configuración estándar de Kubernetes sin investigación experimental
Proyectos SR&ED — Documentación Completa
Proyecto SR&ED #1 de 3
Motor de Detección de Anomalías en Tiempo Real
Experimental Development — Machine Learning / Data Science
✓ Elegible SR&ED Experimental Development
Descripción del Proyecto

NovaMind desarrolló un motor de detección de anomalías capaz de procesar flujos de datos en tiempo real con latencia sub-100ms. El proyecto implicó investigar arquitecturas de modelos híbridos que combinan métodos estadísticos clásicos con redes neuronales, enfrentando incertidumbres sobre la adaptación al concept drift en producción.

Objetivos del Proyecto

Crear un sistema de detección de anomalías que supere las limitaciones de los enfoques batch tradicionales, logrando precisión superior al 92% con tasa de falsos positivos menor al 3%, y capaz de adaptarse dinámicamente a cambios en la distribución de datos sin re-entrenamiento completo.

🔬 Incertidumbres Técnicas
Incertidumbre #1
¿Es posible combinar Isolation Forest con LSTM Autoencoders para detección de anomalías en series temporales de alta frecuencia (10K eventos/seg) manteniendo coherencia en la clasificación? No existe literatura que documente arquitecturas híbridas con estos requisitos de latencia, obligando a diseñar una solución experimental propia.
🧪 Experimentos
  • Baseline con Isolation Forest puro (PR #124, #131) — latencia 180ms, inaceptable
  • LSTM-AE con ventana deslizante de 50 timesteps (PR #145, #163) — pérdida de señal en anomalías cortas
  • Ensemble híbrido con gate neuronal para selección dinámica de modelo (PR #192, #210)
📊 Resultados / Aprendizajes
  • IF puro: recall 78%, latencia inviable para producción
  • LSTM-AE puro: recall 89% pero 340ms de latencia media
  • Ensemble híbrido: recall 93.4%, latencia P99 de 67ms — avance técnico confirmado
Incertidumbre #2
¿Cómo detectar concept drift en flujos no estacionarios sin acceso a etiquetas en tiempo real? Los métodos existentes (ADWIN, Page-Hinkley) asumen distribuciones estacionarias entre cambios, lo que no aplica a datos de comportamiento de usuarios donde el drift es gradual y multimodal.
🧪 Experimentos
  • ADWIN sobre residuales del modelo: falsos positivos excesivos (PR #229, #247)
  • Ventana dual con KL-divergence como señal de drift (PR #265)
  • Detector de drift basado en embeddings del LSTM (investigación Notion doc)
📊 Resultados / Aprendizajes
  • ADWIN: 23% tasa de falsa alarma inaceptable en datos reales
  • KL-divergence: reducción a 8% de falsas alarmas, pero latencia de detección alta
  • Embedding-based drift: 4.1% falsa alarma, detección en <30s — solución adoptada
Nombre Rol % Tiempo anual Dedicación
Dr. Priya Mehta Lead ML Engineer
60%
Diseño arquitectura, experimentación principal
Carlos Vega Senior Data Scientist
45%
Experimentos drift detection, evaluación
Aisha Kamara MLOps Engineer
25%
Infraestructura de streaming, integración producción
Proyecto SR&ED #2 de 3
Pipeline de Integración de Datos Multi-Fuente
Applied Research — Data Engineering / Schema Reconciliation
✓ Elegible SR&ED Applied Research
Descripción del Proyecto

Desarrollo de un pipeline capaz de integrar datos estructurados de 15+ fuentes heterogéneas (SQL, NoSQL, APIs REST, archivos CSV/Parquet) con reconciliación automática de esquemas en conflicto. El proyecto abordó el problema no resuelto de alineación semántica entre entidades de negocio con nomenclaturas distintas.

Objetivos del Proyecto

Eliminar el proceso manual de mapping entre fuentes (estimado en 40h/semana de ingeniería), desarrollando un sistema de inferencia semántica que detecte y resuelva automáticamente conflictos de esquema con precisión superior al 95%, aplicable a nuevas fuentes sin configuración manual.

🔬 Incertidumbres Técnicas
Incertidumbre #1
¿Pueden los embeddings de texto de modelos transformer detectar equivalencias semánticas entre nombres de campos de esquemas empresariales (ej. "customer_id" vs "cust_num" vs "ClienteID")? No existe un benchmark establecido para este dominio específico, y los trabajos previos en schema matching asumen vocabulario controlado.
🧪 Experimentos
  • Comparación de TF-IDF edit-distance vs sentence-transformers en 2.400 pares de campos (PR #55, #67)
  • Fine-tuning de modelo en dataset propietario de 800 mappings históricos (PR #78)
  • Ensemble con reglas heurísticas para casos de alta ambigüedad (PR #89)
📊 Resultados / Aprendizajes
  • TF-IDF: 71% precisión — insuficiente para automatización completa
  • Sentence transformers pre-entrenados: 84% — mejora significativa pero con fallos en acrónimos
  • Modelo fine-tuned + heurísticas: 96.3% precisión en test set — objetivo alcanzado
NombreRol% Tiempo anualDedicación
Min-Ji Park Data Engineer Lead
55%
Diseño pipeline, experimentos semánticos
Raj Patel NLP Researcher
35%
Fine-tuning modelo, evaluación embeddings
Proyecto SR&ED #3 de 3
Módulo de Explicabilidad XAI para Modelos de ML
Experimental Development — Explainable AI / Interpretability
✓ Elegible SR&ED Experimental Development
Descripción del Proyecto

Investigación y desarrollo de un módulo de explicabilidad (XAI) nativo para los modelos de ML de NovaMind, capaz de generar explicaciones locales y globales en tiempo real. El trabajo requirió resolver incertidumbres sobre la aplicabilidad de SHAP/LIME en modelos de ensemble con alta cardinalidad de features.

Objetivos del Proyecto

Proporcionar explicaciones comprensibles para clientes regulados (finanzas, salud) cumpliendo con requisitos de auditoría, con tiempo de generación de explicación menor a 200ms por predicción y fidelidad superior al 90% respecto al modelo original.

🔬 Incertidumbres Técnicas
Incertidumbre #1
¿SHAP o LIME producen explicaciones fieles para modelos de ensemble híbrido con más de 500 features y dependencias no lineales? La literatura existente valida ambos métodos principalmente en modelos simples o datasets de referencia (UCI), sin evidencia para arquitecturas de producción de alta complejidad como la de NovaMind.
🧪 Experimentos
  • SHAP TreeExplainer sobre el ensemble: tiempo 4.2s por muestra — inviable (PR #10)
  • LIME con muestreo local de 100 perturbaciones (PR #22) — fidelidad 71%
  • Kernel SHAP aproximado con coaliciones reducidas (PR #38) — fidelidad 88%, 180ms
  • Explicaciones contrafactuales como complemento (PR #51, Notion doc)
📊 Resultados / Aprendizajes
  • SHAP completo: imposible en producción por latencia
  • LIME: fidelidad insuficiente para auditorías regulatorias
  • Kernel SHAP optimizado: 91.2% fidelidad, 178ms P95 — solución viable
  • Contrafactuales mejoran comprensión del usuario final en test con clientes
Incertidumbre #2
¿Es posible generar explicaciones contrafactuales (qué tendría que cambiar para obtener un resultado diferente) de forma eficiente sin acceso al gradiente del modelo? Los métodos existentes como DiCE o NICE requieren diferenciabilidad o acceso a la estructura interna del modelo, lo que no aplica a los modelos de caja negra de NovaMind.
🧪 Experimentos
  • DiCE model-agnostic con búsqueda aleatoria (PR #51) — demasiado lento, 8s/muestra
  • Búsqueda genética con restricciones de plausibilidad (Notion doc prototipos)
  • Nearest-neighbor en espacio latente del LSTM-AE como punto de partida (PR #38)
📊 Resultados / Aprendizajes
  • Búsqueda aleatoria: impracticable en espacio de alta dimensión
  • Algoritmo genético: 94% de contrafactuales válidos en 1.1s media
  • Combinación NN-latent + genético: 97% validez, 0.6s — avance técnico documentado
NombreRol% Tiempo anualDedicación
Dr. Priya Mehta Lead ML Engineer
30%
Dirección investigación XAI, revisión técnica
Fatima Al-Rashid ML Researcher (XAI)
70%
Implementación SHAP/LIME/contrafactuales, todos los experimentos
Thomas Bouchard Backend Engineer
20%
Integración API, optimización de latencia
Estimación de Beneficio Fiscal SR&ED
Basado en ~4.500 horas elegibles SR&ED (3 proyectos × promedio personal × % dedicación), a tasa combinada federal+provincial Ontario de ~53% sobre costes salariales elegibles.
Crédito fiscal estimado
$238,500
CAD · sujeto a revisión CRA
Este documento fue generado por CULTIVA IA usando la skill organizador-proyectos-sred. Las cifras son estimativas y deben ser validadas por un consultor SR&ED certificado antes de presentar a la CRA.