10 años del IDS UDD · Taller Codex para Data Science · Evento oficial de la OpenAI Build Week
El nuevo flujo de trabajo en Data Science
De escribir código a especificar, delegar y verificar
Germán Gómez
Director del Magíster en Data Science UDD · Docente investigador IDS
20 de julio de 2026 · Campus RESB, Las Condes
Bienvenida breve. Marco: celebramos 10 años del IDS con un taller práctico. Esta charla instala el marco y la evidencia; Alonso mostrará Codex en tareas reales y Cristian cerrará con la arquitectura que vuelve el trabajo reproducible, trazable y defendible. Regla de la charla: cada afirmación relevante viene con un paper o un reporte serio detrás; y también voy a mostrar la evidencia que incomoda.
Para ubicarnos
La jornada de hoy recorre un mismo flujo
1 · Esta charla
Por qué el flujo de trabajo se está reorganizando: la evidencia 2024–2026, a favor y en contra.
2 · Codex en tareas reales (Alonso Astroza)
El flujo en acción: delegar tareas concretas de data science y verificar resultados.
3 · Arquitectura agéntica y trabajo trazable (Cristian Candia)
Cómo pasar de una respuesta plausible a un resultado reproducible, verificable y defendible.
La pregunta que cruza el día:
si los agentes ya ejecutan, ¿dónde queda nuestro aporte?
30 segundos. La charla no compite con las demos: entrega el mapa. Anunciar la pregunta guía para que la audiencia la lleve todo el día.
Somos parte del calendario oficial
Este taller es evento oficial de la OpenAI Build Week
¿Qué es Codex?
El agente de ingeniería de OpenAI: se le delega una tarea (en la terminal, el IDE, la web o el móvil), trabaja en un sandbox con el repositorio, ejecuta y prueba, y devuelve un resultado para revisar. Hoy lo veremos aplicado a data science.
Build Week Challenge
Proyectos construidos con Codex compiten por premios: cash, créditos de OpenAI, pases a DevDay y experiencias con el equipo de OpenAI. Individual o en equipo; no exige experiencia previa.
Fechas clave
13 jul — abre el challenge
21 jul — cierre de postulaciones (¡mañana!)
22 jul – 7 ago — evaluación
12 ago — ganadores
Lo que construyan hoy en el taller puede postularse mañana.
Registro y bases: openai.devpost.com
openai.com/build-week — criterios de evaluación: implementación técnica, diseño y UX, impacto potencial y calidad de la idea, con uso reflexivo de GPT-5.6 y Codex.
Anuncio con orgullo: el taller aparece en el calendario oficial de la OpenAI Build Week. Explicar Codex en 30 segundos para nivelar a la sala (Alonso profundiza después). El gancho: el challenge cierra MAÑANA 21 de julio — lo que armen hoy en el bloque práctico es un candidato natural. Se postula por Devpost (descripción, video demo, repo). Evalúan implementación técnica, diseño/UX, impacto y calidad de la idea. Hay office hours en el Discord de Build Week hoy mismo (10 a.m. PDT). Invitar a formar equipos durante el almuerzo.
El punto de partida
El flujo que enseñamos y el que está emergiendo
Contraste inicial. Mismo problema en 2016: notebooks, horas de limpieza manual, cada línea escrita a mano. En 2026: se especifica la tarea, un agente ejecuta tramos completos del ciclo (preparación, EDA, modelamiento base) y el trabajo humano se concentra en los extremos: definir bien y verificar bien. Mapa del territorio: survey de agentes LLM para estadística y DS, arXiv 2412.14222.
Votación inicial sobre productividad personal con IA
Antes de empezar, votemos
"Con las herramientas de IA actuales, hoy soy más rápido/a en mi trabajo con datos de lo que era hace un año."
1 Totalmente de acuerdo
2 De acuerdo
3 Indeciso/a
4 En desacuerdo
5 Totalmente en desacuerdo
Recuerden su número del 1 al 5. Repetiremos exactamente esta escala al final.
PREGUNTA DE POSICIONAMIENTO. Pedir que escaneen el QR o entren en menti.com con el código 2705 4176. Leer la afirmación, dar 20–30 segundos de silencio sin reformular y abrir la primera votación del 1 al 5. Mostrar la distribución de Mentimeter y describirla en voz alta ("veo mayoría en 1 y 2…"), pero no interpretarla todavía. Decir solo: "recuerden su número; repetimos la misma escala al final". Si falla la conexión, usar dedos del 1 al 5 como respaldo. El propósito es contrastar percepción y medición después del experimento aleatorizado de METR.
La tesis de esta charla
La tesis de esta charla
El centro de gravedad del trabajo se desplaza: de escribir código a especificar, delegar y verificar.
El cuello de botella no desaparece: se traslada del código a una combinación de especificación, contexto, verificación, integración y mantenimiento del conocimiento que alimenta a los agentes.
Y esa tesis hay que defenderla con evidencia — incluida la que incomoda.
Enunciar la tesis completa y prometer el estándar: no es una charla de promesas, es una charla de evidencia. Adelantar que un experimento aleatorizado encontró que la IA hizo más lentos a desarrolladores expertos, y que lo vamos a mirar de frente.
Capacidad · 1/3
La capacidad sube rápido, pero el andamiaje explica buena parte del salto
MLE-bench: Chan et al., arXiv 2410.07095. Mejores resultados publicados 2025–2026: Operand Quant, leaderboard MLE-bench y HASTE. HASTE usa MLE-bench Lite y no se compara directamente con la serie principal.
La serie principal reúne competencias Kaggle de preparación, entrenamiento y experimentación: el mejor sistema pasó de medalla en 1 de cada 6 a cerca de 2 de cada 3. El salto no viene solo de modelos mayores; también viene de planificación, verificación, múltiples trayectorias y memoria reutilizable. HASTE queda deliberadamente separado: reporta 77,3% en MLE-bench Lite, 17 de 22 tareas, en una campaña de una sola semilla. Sirve para mostrar el valor de acumular habilidades, no para extender la misma curva.
Capacidad · 2/3
La frontera: tareas acotadas sí, tareas abiertas no
DABstep: Egg et al., arXiv 2506.23719 (Adyen + Hugging Face). DSBench: arXiv 2409.07703. DS-STAR (Google) elevó DABstep a ~45% con verificación explícita (arXiv 2509.21825).
Esta es la brecha que define el presente: en tareas fáciles y bien especificadas, los agentes superan 76%; en tareas difíciles —multi-paso, cruce de fuentes, documentación heterogénea— caen a 14,6%. En DSBench el mejor agente resuelve un tercio de lo que resuelve un humano experto (34% vs 65%). Y cómo se cierra la brecha: DS-STAR sube DABstep a ~45% agregando un agente VERIFICADOR. La dirección de la mejora confirma la tesis: se avanza agregando verificación, no solo modelo.
Capacidad · 3/3
Cuidado con las métricas: una prueba deja de servir si ya no mide lo que promete
OpenAI dejó de usar SWE-bench Verified
Al auditar una submuestra difícil: 59% tenía tests defectuosos o descripciones problemáticas, más evidencia de contaminación por entrenamiento.
SWE-Bench+: fuga de soluciones
Al filtrar casos donde la respuesta estaba en el propio issue, la tasa real del agente líder cayó de 12,5% a 4%.
Si la métrica deja de medir lo que promete, optimizarla ya no es progreso.
Una intuición familiar para cualquier profesional de datos, y que aplica de lleno a la IA.
OpenAI, "Why we no longer evaluate SWE-bench Verified" (2026). SWE-Bench+: arXiv 2410.06992.
Punto metodológico para la audiencia académica: los saltos espectaculares en benchmarks a veces son sobreajuste, contaminación o mala medición, no capacidad real. OpenAI mismo deprecó su benchmark estrella para lanzamientos frontier. Lección transversal del día: en la era de agentes, diseñar la EVALUACIÓN es parte del trabajo, no un trámite.
Productividad · 1/3
El resultado más incómodo: METR 2025
METR, experimento aleatorizado, jul 2025 (arXiv 2507.09089): repositorios propios maduros (>1M líneas), Cursor Pro + Claude 3.5/3.7 Sonnet.
En este experimento con tareas reales, los expertos tardaron 19% más con IA. La brecha de percepción fue de 39 puntos: creían haber ahorrado 20% y el resultado medido fue 19% más de tiempo. Las condiciones importan: eran expertos trabajando en sus propios repositorios maduros, con estándares altos. El estudio no demuestra que la IA siempre ralentice; muestra que el costo de revisar e integrar puede superar el ahorro de generar código.
Productividad · 2/3
…y lo que pasó después: la evidencia corre detrás de la frontera
Febrero 2026: actualización de METR 57 desarrolladores, 800+ tareas; resultados afectados por sesgo de selección.
−18%
estimación en 10 participantes originales; intervalo de confianza: −38% a +9%. El resultado sigue siendo inconcluso.
−4%
estimación en 47 participantes nuevos; intervalo de confianza: −15% a +9%. También es inconcluso.
METR concluye que este diseño ya no estima de forma confiable el efecto actual:
los modelos cambian más rápido que los experimentos
sesgo de selección: muchos participantes ya no aceptan trabajar sin IA
La pregunta útil no es “¿la IA acelera?”, sino “¿acelera este flujo, con estos criterios?”.
METR, “We are changing our developer productivity experiment design” (24 feb 2026). METR considera que la estimación central es una señal poco confiable del impacto actual.
Honestidad intelectual: el resultado de 2025 no era la palabra final. Los datos nuevos apuntan a aceleración, pero ambos intervalos incluyen ausencia de efecto y el propio diseño tiene sesgos importantes. La lección no es “la IA acelera” ni “la IA frena”. La consecuencia práctica es medir en el contexto propio: tiempo total, calidad, revisión, integración y retrabajo.
Punto de control · votemos de nuevo
En METR 2025, expertos 19% más lentos con IA, creyendo ser 20% más rápidos. ¿Cuál es la lectura más defendible?
A. Las herramientas de 2025 todavía generaban código de mala calidad.
B. Los desarrolladores no sabían dar buenas instrucciones.
C. El costo de revisar e integrar superó el ahorro de escribir.
D. Con 16 participantes, el estudio no permite concluir nada.
30 segundos para pensar · comenten con su vecino/a · votamos todos a la vez
PREGUNTA BISAGRA. Avanzar en Mentimeter a la segunda pregunta. Dar 30 segundos de silencio, 30 segundos con la persona de al lado y pedir voto simultáneo A–D. Mostrar la distribución antes de explicar. Si falla la conexión, usar dedos (1=A … 4=D). Mapa de errores: A confunde capacidad con causa; el código era plausible, pero el costo estaba en revisarlo e integrarlo. B reduce el fenómeno a destreza individual; eran usuarios experimentados con libre elección de herramienta. C es la respuesta más defendible: el cuello de botella se desplazó aguas abajo. D confunde tamaño muestral con validez: una muestra pequeña ensancha el intervalo (+2% a +39%), pero no invalida el diseño aleatorizado. Si domina C, avanzar. Si hay dispersión, explicar en 60 segundos dónde se fue el tiempo.
Productividad · 3/3
Escribir código no es lo mismo que ponerlo en producción
Demirer, Musolff y Yang (2026), "Writing code versus shipping code", CEPR/VoxEU.
La generación crece con fuerza (+180% en commits; 7× más líneas con agentes), pero lo que llega a producción crece mucho menos (+30% y +20% en versiones publicadas, según la comparación). El trabajo se desplaza hacia revisión, integración, pruebas y publicación. Frase para dejar instalada: la IA no elimina el flujo productivo; lo desbalancea.
Adopción
Adopción masiva, valor concentrado
McKinsey, The State of AI (2025/2026); Stanford HAI AI Index 2026. Gartner: 40% de las aplicaciones empresariales tendrán agentes a fines de 2026 y >40% de estos proyectos serán cancelados hacia 2027.
La división real no es quién tiene IA, sino quién rediseña procesos, métricas y verificación. El grupo que captura más valor no se distingue solo por el modelo: rediseña flujos de trabajo, gobierna los datos y define indicadores. La adopción puede crecer al mismo tiempo que fracasan muchos proyectos. La herramienta no es el único factor limitante.
El nuevo flujo
El flujo en cinco movimientos
1
Especificar
Problema, criterios de éxito y restricciones.
2
Contextualizar
Datos, documentación, ejemplos y reglas reutilizables.
3
Delegar
Tareas acotadas a uno o varios agentes.
4
Verificar
Pruebas, evaluación y revisión de supuestos.
5
Consolidar
Flujo productivo, reporte o herramienta durable.
Si falla la verificación: volver al contexto y a la especificación
Preparar el contexto se vuelve tan importante como preparar los datos.
Síntesis propia de lo que documentan OpenAI, Anthropic y Google. ANUNCIAR LA CADENA aquí: "para llegar a la pregunta que importa — qué delego, qué hago en conjunto, qué retengo — vamos a responder tres preguntas más simples primero: qué se delega y quién verifica; qué necesita el agente y qué pasa si nadie lo mantiene; y dónde va la verificación". Cada slide siguiente responde una (encadenamiento explícito: reduce la distancia hasta la pregunta compleja). Los movimientos 1, 2 y 4 son donde vive el criterio — y son humanos. Explicar el puente visible: Cristian retomará este recorrido como cuatro fases operativas — explorar, ejecutar, revisar y finalizar — y mostrará las piezas que dejan evidencia en cada una. El resto del día recorre exactamente esto: Alonso con Codex, especialmente delegar y verificar; Cristian con skills, agentes, handoffs, harnesses y gates para volver el flujo reproducible y trazable. Dato de contexto de OpenAI interno: 99,8% de los tokens internos vienen de Codex; ~25% de los usuarios ya delega tareas de más de 8 horas; crecimiento 137x en usuarios NO desarrolladores (arXiv 2606.26959). Nuevos objetos de trabajo: AGENTS.md, skills, harnesses, evals.
La cadena · ¿qué se delega y quién verifica?
Netflix: delegar la ejecución, retener la hipótesis
Netflix TechBlog, “A Human-Augmenting Agentic Workflow for Causal Inference” (8 jun 2026). Caso interno; evaluación pública adicional en datos sintéticos ACIC.
Este caso es análisis de datos, no ingeniería de software: inferencia causal con datos observacionales. Se delegan la ejecución estadística, los diagnósticos y análisis de sensibilidad. El humano conserva la pregunta, los supuestos, los factores de confusión y la decisión final. Un segundo agente revisa el proceso, pero no reemplaza la responsabilidad humana. Netflix también reporta una evaluación pública en datos sintéticos ACIC; esa evaluación no prueba desempeño general en datos reales.
La cadena · ¿qué necesita el agente — y qué pasa si nadie lo mantiene?
El contexto es el activo — y se deprecia
Anthropic, “How Anthropic enables self-service data analytics with Claude” (3 jun 2026). Caso interno del proveedor: 95% de consultas automatizadas con ~95% de precisión agregada.
En las evaluaciones internas de Anthropic, la precisión no superaba 21% sin guías que codificaran el conocimiento del dominio. Con esas guías superó 95% de forma agregada. Sin mantenimiento, cayó de cerca de 95% a cerca de 65% en un mes porque cambiaron modelos y definiciones. Es telemetría del propio proveedor, no un estudio independiente. La lección es operativa: el contexto útil debe mantenerse junto con los datos y transformaciones.
La cadena · ¿dónde va la verificación?
Por qué la verificación intermedia no es opcional
Aritmética del fallo compuesto. Mitigaciones: cadenas cortas, validación intermedia, herramientas que pueden repetirse sin duplicar efectos y registro de estado.
Un agente que acierta 95% por paso parece confiable en la demo. Encadenados 10 pasos: 60% de confiabilidad del flujo completo. Esta aritmética explica por qué Gartner proyecta >40% de proyectos agentic cancelados hacia 2027, y por qué las arquitecturas que funcionan (DS-STAR, Netflix) meten verificación ENTRE pasos, no solo al final. Diseñar dónde van los puntos de verificación: trabajo de criterio, imposible de delegar del todo.
La cadena · la pregunta final
Colaborar no siempre gana: cuándo sí
Metaanálisis de 106 experimentos, 370 tamaños de efecto (Nature Human Behaviour):
en promedio, humano+IA rinde peor que el mejor de los dos por separado (g = −0,23).
Pierde en tareas de decisión (la IA ya supera al humano y la persona interviene de más).
Gana en tareas de creación, cuando cada parte aporta una fortaleza distinta dentro de la misma tarea.
La pregunta profesional deja de ser "¿uso IA o no?"
y pasa a ser "¿qué delego por completo, qué hago en conjunto y qué retengo?"
Vaccaro, Almaatouq y Malone (2024), Nature Human Behaviour 8, 2293–2303.
CIERRE DE LA CADENA: recapitular en una frase las tres respuestas construidas (se delega la ejecución con verificación; el agente necesita contexto mantenido; la verificación va entre pasos) y recién entonces plantear la pregunta final — la sala ya tiene las piezas para responderla. Este resultado sorprende a casi todos: la colaboración humano-IA NO es gratis. Cuando la IA ya es mejor en la subtarea (muchas decisiones de clasificación), el humano en el loop RESTA. Cuando la tarea tiene componentes complementarios (creación, análisis con contexto de negocio), la combinación gana. Diseñar esa partición — automatizar lo acotado, colaborar donde hay complementariedad, retener lo crítico — es una competencia profesional en sí misma. Es exactamente el criterio que el MDS tiene que formar.
Implicaciones · 1/2
El primer peldaño se estrecha — y el atajo cobra caro
−13%
empleo relativo de 22–25 años en ocupaciones más expuestas a IA (datos administrativos de nómina, EE.UU.); estabilidad en trabajadores con experiencia
7×
los roles junior expuestos a IA tienen 7 veces más probabilidad de exigir habilidades tradicionalmente sénior (PwC, mil millones de avisos, 27 países)
Aprender con IA: importa cómo se usa
Experimento aleatorizado: grupo con IA 50% en la prueba; grupo sin IA 67%.
Análisis exploratorio: delegación total, <40%; patrones orientados a comprender, ≥65%.
Regla para aprender: pide explicaciones, predice el resultado, depura errores y comprueba que puedes justificar la solución sin ayuda.
Stanford (nóminas, 2025); PwC Global AI Jobs Barometer 2026; Anthropic, experimento con 52 desarrolladores (29 ene 2026). Los patrones de interacción son asociaciones, no efectos causales.
La contracción junior se expresa como menor crecimiento relativo y contratación plana, no como despidos masivos. En el experimento de Anthropic, usar IA redujo 17 puntos el dominio inmediato frente a programar sin IA. El desglose por patrones de uso fue exploratorio: delegar por completo se asoció con resultados bajos; pedir explicaciones, formular preguntas conceptuales y resolver errores se asoció con resultados altos. No afirmar que esos patrones causan por sí solos la diferencia. Para estudiantes: usar IA para comprender y verificar, no solo para terminar antes.
Implicaciones · 2/2
Chile: talento de sobra, escalamiento pendiente
ILIA 2025, CENIA/CEPAL (19 países). Escalamiento: MAS Analytics 2026 (~30% adopta, 3,6% escala a flujos centrales).
El cierre local. Chile lidera la región: primer lugar en alfabetización en IA, talento avanzado, 15% de la capacidad de datacenters de LatAm. Pero la adopción industrial es CRÍTICA: 39,3 puntos, puesto 12 de 19; y de las empresas que adoptan, solo 3,6% escala a flujos centrales. Es la brecha global (adopción vs valor) en versión local y más aguda. Traducción para esta sala: el problema de Chile no es falta de talento ni de herramientas — es exactamente lo que este taller entrena: rediseñar flujos con criterio, contexto y verificación. Los que están aquí son los que pueden cerrar esa brecha.
Síntesis: el criterio profesional es el recurso escaso
Síntesis
No es que programar deje de importar. Importa como sustrato de algo superior.
Lo que escasea — y lo que este magíster forma — es la capacidad de definir problemas, empaquetar contexto, diseñar evaluaciones, decidir qué delegar y asumir responsabilidad por el resultado.
Cerrar la tesis refinada: el cuello de botella se trasladó del código a especificación + contexto + verificación + mantenimiento del conocimiento. Los fundamentos (estadística, inferencia causal, evaluación) valen MÁS en este mundo, no menos: sin ellos no se puede verificar ni dirigir agentes.
Votación final y paso a la práctica
Antes de pasar a la práctica · votemos de nuevo
"Hoy soy más rápido/a en mi trabajo con datos de lo que era hace un año." ¿Mantienen su voto?
1 Totalmente de acuerdo · 2 De acuerdo · 3 Indeciso/a · 4 En desacuerdo · 5 Totalmente en desacuerdo
En el estudio METR de 2025, los desarrolladores creían ser 20% más rápidos. La medición mostró 19% más de tiempo.
La única forma de saber qué aportan estas herramientas a tu flujo es usarlas con método y medir.
Ahora Alonso la pondrá a prueba con Codex. Cristian cerrará mostrando cómo aceptar el resultado con evidencia.
Instituto de Data Science UDD · 10 años
Gracias — Germán Gómez · [email protected] Instituto de Data Science UDD
RE-VOTO. Avanzar en Mentimeter a la votación final con la misma escala del 1 al 5. Dar 15 segundos, mostrar el resultado y compararlo con la distribución inicial. Preguntar a una o dos personas: "¿Cambiaste de número? ¿Qué evidencia influyó?". Si falla la conexión, repetir la escala con dedos. No importa la dirección del cambio; el aprendizaje visible es distinguir percepción de medición. Remate: no les pido que me crean, les pido que midan. Mencionar Build Week como oportunidad secundaria. TRANSICIÓN: "Mi tesis es que el criterio se volvió el recurso escaso. Alonso mostrará cómo delegar y verificar tareas reales con Codex; Cristian cerrará mostrando la arquitectura necesaria para que esos resultados no solo parezcan listos, sino que sean reproducibles, trazables y defendibles". PUENTE SUGERIDO PARA CRISTIAN: "Germán mostró dónde queda nuestro aporte y Alonso mostró la ejecución. Ahora veremos qué debe existir para poder decir ‘listo’ con evidencia".