Data Analyst Portfolio: Project 06
Eficiencia Operacional NYC 311
Dashboard de analisis operacional sobre las solicitudes 311 de la Ciudad de Nueva York. Combina mineria de procesos, analisis estadistico de SLA y priorizacion Pareto para identificar cuellos de botella, evaluar el cumplimiento de tiempos de respuesta y guiar decisiones de mejora operativa a traves de 3.5 millones de registros del 2024.
El Reto
- *Que agencias cumplen sus compromisos de tiempo de respuesta y cuales no?
- *Donde se concentran los cuellos de botella en el flujo operacional?
- *Que tipos de queja generan el mayor volumen y como priorizarlos?
- *Existen patrones geograficos o estacionales en las solicitudes?
Por Que Este Enfoque
- *Mineria de procesos revela el flujo real, no el teorico, de las operaciones.
- *Pruebas estadisticas (z-test + Bonferroni) dan rigor a la comparacion entre agencias.
- *Visualizaciones D3.js custom (Sankey, coropletico, gauge) permiten explorar datos complejos.
- *Pipeline parquet + FastAPI mantiene 3.5M filas consultables en milisegundos.
Fuente de Datos
Fuente
NYC Open Data / Socrata API
Registros
~3.5 millones de filas
Periodo
Enero - Diciembre 2024
Dataset ID
erm2-nwe9
Limitaciones: datos gubernamentales con calidad variable. No todas las agencias tienen SLA definido (ej. NYPD, Parks). No se incluyen datos de costos operativos. Los tiempos de resolucion dependen de la fecha de cierre registrada, que puede no reflejar la resolucion real.
Contexto del Portafolio
Siniestralidad, reservas y tendencias para una cartera de seguros.
Analisis de cohortes, retencion, RFM y LTV para e-commerce.
Pruebas A/B con enfoque frecuentista, bayesiano y secuencial.
Reportes automatizados de KPIs SaaS con deteccion de anomalias.
Portfolio multi-activo con VaR, Monte Carlo y frontera eficiente.
Eficiencia operacional NYC 311 con mineria de procesos y SLA.
Proyecto actual
Metodologia
Pipeline de Datos
- -ETL en 3 etapas via Socrata API
- -Limpieza y tipificacion de 3.5M registros
- -Exportacion a parquet columnar
Analisis de SLA
- -Pruebas z para comparacion de tasas
- -Correccion de Bonferroni para comparaciones multiples
- -Clasificacion de cumplimiento por agencia
Mineria de Procesos
- -Diagrama Sankey de flujo operacional
- -Deteccion de cuellos de botella
- -Descomposicion de tiempos de resolucion
Pareto y Priorizacion
- -Regla 80/20 por tipo de queja
- -Scatter matrix de prioridad
- -Analisis de concentracion por agencia
Como Navegar
Retos y Aprendizajes
3.5M filas en el navegador
Procesamiento de 3.5 millones de registros requirio column pruning en parquet y agregacion en el backend para mantener tiempos de carga aceptables en Cloud Run.
D3.js custom vs librerias prefabricadas
Visualizaciones clave (Sankey, coropletico, gauge) necesitaban control total de layout e interaccion que Recharts no ofrecia. Se implementaron desde cero con D3.
Datos SLA nulos
Muchas agencias (NYPD, Parks) carecen de definicion de SLA en el dataset. Se implemento codificacion defensiva y se reportan como "Sin SLA definido" en vez de excluirlas.
Sparsity en heatmaps
El bucket "Otros" dominaba los heatmaps de tipo de queja. Se cambio a complaint_type sin agrupar, filtrando por top N, para revelar patrones utiles.
Stack Tecnologico
Data Pipeline
Backend
Frontend