10 años del IDS UDD · Taller Codex para Data Science · Evento oficial de la OpenAI Build Week

El nuevo flujo de trabajo
en Data Science

De escribir código a especificar, delegar y verificar

Germán Gómez

Director del Magíster en Data Science UDD · Docente investigador IDS

20 de julio de 2026 · Campus RESB, Las Condes

Bienvenida breve. Marco: celebramos 10 años del IDS con un taller práctico. Esta charla instala el marco y la evidencia; Alonso mostrará Codex en tareas reales y Cristian cerrará con la arquitectura que vuelve el trabajo reproducible, trazable y defendible. Regla de la charla: cada afirmación relevante viene con un paper o un reporte serio detrás; y también voy a mostrar la evidencia que incomoda.
Para ubicarnos

La jornada de hoy recorre un mismo flujo

1 · Esta charla

Por qué el flujo de trabajo se está reorganizando: la evidencia 2024–2026, a favor y en contra.

2 · Codex en tareas reales (Alonso Astroza)

El flujo en acción: delegar tareas concretas de data science y verificar resultados.

3 · Arquitectura agéntica y trabajo trazable (Cristian Candia)

Cómo pasar de una respuesta plausible a un resultado reproducible, verificable y defendible.

La pregunta que cruza el día:

si los agentes ya ejecutan, ¿dónde queda nuestro aporte?

30 segundos. La charla no compite con las demos: entrega el mapa. Anunciar la pregunta guía para que la audiencia la lleve todo el día.
Somos parte del calendario oficial

Este taller es evento oficial de la OpenAI Build Week

¿Qué es Codex?

El agente de ingeniería de OpenAI: se le delega una tarea (en la terminal, el IDE, la web o el móvil), trabaja en un sandbox con el repositorio, ejecuta y prueba, y devuelve un resultado para revisar. Hoy lo veremos aplicado a data science.

Build Week Challenge

Proyectos construidos con Codex compiten por premios: cash, créditos de OpenAI, pases a DevDay y experiencias con el equipo de OpenAI. Individual o en equipo; no exige experiencia previa.

Fechas clave

13 jul — abre el challenge

21 jul — cierre de postulaciones (¡mañana!)

22 jul – 7 ago — evaluación

12 ago — ganadores

Lo que construyan hoy en el taller puede postularse mañana.

Registro y bases: openai.devpost.com

openai.com/build-week — criterios de evaluación: implementación técnica, diseño y UX, impacto potencial y calidad de la idea, con uso reflexivo de GPT-5.6 y Codex.
Anuncio con orgullo: el taller aparece en el calendario oficial de la OpenAI Build Week. Explicar Codex en 30 segundos para nivelar a la sala (Alonso profundiza después). El gancho: el challenge cierra MAÑANA 21 de julio — lo que armen hoy en el bloque práctico es un candidato natural. Se postula por Devpost (descripción, video demo, repo). Evalúan implementación técnica, diseño/UX, impacto y calidad de la idea. Hay office hours en el Discord de Build Week hoy mismo (10 a.m. PDT). Invitar a formar equipos durante el almuerzo.
El punto de partida

El flujo que enseñamos y el que está emergiendo

Comparación entre el flujo clásico y el flujo emergente de proyectos de datos El flujo clásico recorre entender el negocio, preparar datos, modelar, evaluar y desplegar. El flujo emergente concentra a la persona en especificar, contextualizar y verificar, mientras el agente ejecuta tramos completos y vuelve al contexto cuando la verificación falla. Flujo clásico de proyectos de datos (CRISP-DM): la persona ejecuta cada etapa Entender el negocio Preparar datos Modelar Evaluar Desplegar Ciclo emergente: la persona especifica y verifica; el agente ejecuta tramos completos Especificarproblema y criterios Contextualizardatos y documentaciónejemplos Delegarel agente ejecuta Verificarpruebas y supuestosjuicio iterar: redirigir al agente
Contraste inicial. Mismo problema en 2016: notebooks, horas de limpieza manual, cada línea escrita a mano. En 2026: se especifica la tarea, un agente ejecuta tramos completos del ciclo (preparación, EDA, modelamiento base) y el trabajo humano se concentra en los extremos: definir bien y verificar bien. Mapa del territorio: survey de agentes LLM para estadística y DS, arXiv 2412.14222.

Votación inicial sobre productividad personal con IA

Antes de empezar, votemos

"Con las herramientas de IA actuales, hoy soy más rápido/a en mi trabajo con datos de lo que era hace un año."

1
Totalmente de acuerdo

2
De acuerdo

3
Indeciso/a

4
En desacuerdo

5
Totalmente en desacuerdo

Recuerden su número del 1 al 5. Repetiremos exactamente esta escala al final.

PREGUNTA DE POSICIONAMIENTO. Pedir que escaneen el QR o entren en menti.com con el código 2705 4176. Leer la afirmación, dar 20–30 segundos de silencio sin reformular y abrir la primera votación del 1 al 5. Mostrar la distribución de Mentimeter y describirla en voz alta ("veo mayoría en 1 y 2…"), pero no interpretarla todavía. Decir solo: "recuerden su número; repetimos la misma escala al final". Si falla la conexión, usar dedos del 1 al 5 como respaldo. El propósito es contrastar percepción y medición después del experimento aleatorizado de METR.

La tesis de esta charla

La tesis de esta charla

El centro de gravedad del trabajo se desplaza:
de escribir código a especificar, delegar y verificar.

El cuello de botella no desaparece: se traslada del código a una combinación de especificación, contexto, verificación, integración y mantenimiento del conocimiento que alimenta a los agentes.

Y esa tesis hay que defenderla con evidencia — incluida la que incomoda.

Enunciar la tesis completa y prometer el estándar: no es una charla de promesas, es una charla de evidencia. Adelantar que un experimento aleatorizado encontró que la IA hizo más lentos a desarrolladores expertos, y que lo vamos a mirar de frente.
Capacidad · 1/3

La capacidad sube rápido, pero el andamiaje explica buena parte del salto

Evolución de resultados con nivel medalla en MLE-bench La serie principal aumenta desde 16,9 por ciento en octubre de 2024 a 39,6 por ciento en 2025 y cerca de 64 a 65 por ciento en julio de 2026. HASTE reporta 77,3 por ciento en MLE-bench Lite, un subconjunto de 22 tareas que no es directamente comparable. MLE-bench: % de competencias Kaggle con nivel medalla (mejor sistema publicado) 20% 40% 60% 80% 16,9% o1-preview + AIDE 34,1% con 8 intentos 39,6% Operand Quant ~64–65% 77,3% HASTE · Lite (22 tareas; no comparable) oct 2024 2025 jul 2026
MLE-bench: Chan et al., arXiv 2410.07095. Mejores resultados publicados 2025–2026: Operand Quant, leaderboard MLE-bench y HASTE. HASTE usa MLE-bench Lite y no se compara directamente con la serie principal.
La serie principal reúne competencias Kaggle de preparación, entrenamiento y experimentación: el mejor sistema pasó de medalla en 1 de cada 6 a cerca de 2 de cada 3. El salto no viene solo de modelos mayores; también viene de planificación, verificación, múltiples trayectorias y memoria reutilizable. HASTE queda deliberadamente separado: reporta 77,3% en MLE-bench Lite, 17 de 22 tareas, en una campaña de una sola semilla. Sirve para mostrar el valor de acumular habilidades, no para extender la misma curva.
Capacidad · 2/3

La frontera: tareas acotadas sí, tareas abiertas no

Diferencia entre tareas de datos acotadas y abiertas DABstep alcanza 76 por ciento en tareas fáciles y 14,6 por ciento en tareas difíciles. En DSBench, el mejor agente obtiene 34 por ciento frente a 65 por ciento de una persona experta. 50% 100% 76% 14,6% 34% 65% DABstepfáciles DABstepdifíciles DSBenchmejor agente DSBenchhumano Análisis multi-pasocon datos reales de pagos Análisis realista(ModelOff + Kaggle)
DABstep: Egg et al., arXiv 2506.23719 (Adyen + Hugging Face). DSBench: arXiv 2409.07703. DS-STAR (Google) elevó DABstep a ~45% con verificación explícita (arXiv 2509.21825).
Esta es la brecha que define el presente: en tareas fáciles y bien especificadas, los agentes superan 76%; en tareas difíciles —multi-paso, cruce de fuentes, documentación heterogénea— caen a 14,6%. En DSBench el mejor agente resuelve un tercio de lo que resuelve un humano experto (34% vs 65%). Y cómo se cierra la brecha: DS-STAR sube DABstep a ~45% agregando un agente VERIFICADOR. La dirección de la mejora confirma la tesis: se avanza agregando verificación, no solo modelo.
Capacidad · 3/3

Cuidado con las métricas: una prueba deja de servir si ya no mide lo que promete

OpenAI dejó de usar SWE-bench Verified

Al auditar una submuestra difícil: 59% tenía tests defectuosos o descripciones problemáticas, más evidencia de contaminación por entrenamiento.

SWE-Bench+: fuga de soluciones

Al filtrar casos donde la respuesta estaba en el propio issue, la tasa real del agente líder cayó de 12,5% a 4%.

Si la métrica deja de medir lo que promete,
optimizarla ya no es progreso.

Una intuición familiar para cualquier profesional de datos, y que aplica de lleno a la IA.

OpenAI, "Why we no longer evaluate SWE-bench Verified" (2026). SWE-Bench+: arXiv 2410.06992.
Punto metodológico para la audiencia académica: los saltos espectaculares en benchmarks a veces son sobreajuste, contaminación o mala medición, no capacidad real. OpenAI mismo deprecó su benchmark estrella para lanzamientos frontier. Lección transversal del día: en la era de agentes, diseñar la EVALUACIÓN es parte del trabajo, no un trámite.
Productividad · 1/3

El resultado más incómodo: METR 2025

Resultado del experimento METR 2025 Expertos pronosticaron 38 por ciento menos tiempo y los desarrolladores 24 por ciento menos. Después de trabajar, los participantes creyeron haber ahorrado 20 por ciento, pero la medición mostró 19 por ciento más tiempo con IA. Cambio en el tiempo de tarea con IA (experimento aleatorizado, 16 expertos, 246 tareas) 0% −25% (más rápido) +25% (más lento) Pronóstico de expertos: −38% Pronóstico de los propios devs: −24% Lo que creyeron después: −20% Medido: +19%
METR, experimento aleatorizado, jul 2025 (arXiv 2507.09089): repositorios propios maduros (>1M líneas), Cursor Pro + Claude 3.5/3.7 Sonnet.
En este experimento con tareas reales, los expertos tardaron 19% más con IA. La brecha de percepción fue de 39 puntos: creían haber ahorrado 20% y el resultado medido fue 19% más de tiempo. Las condiciones importan: eran expertos trabajando en sus propios repositorios maduros, con estándares altos. El estudio no demuestra que la IA siempre ralentice; muestra que el costo de revisar e integrar puede superar el ahorro de generar código.
Productividad · 2/3

…y lo que pasó después: la evidencia corre detrás de la frontera

Febrero 2026: actualización de METR
57 desarrolladores, 800+ tareas; resultados afectados por sesgo de selección.

−18%

estimación en 10 participantes originales; intervalo de confianza: −38% a +9%. El resultado sigue siendo inconcluso.

−4%

estimación en 47 participantes nuevos; intervalo de confianza: −15% a +9%. También es inconcluso.

METR concluye que este diseño ya no estima de forma confiable el efecto actual:

  • los modelos cambian más rápido que los experimentos
  • sesgo de selección: muchos participantes ya no aceptan trabajar sin IA

La pregunta útil no es “¿la IA acelera?”, sino “¿acelera este flujo, con estos criterios?”.

METR, “We are changing our developer productivity experiment design” (24 feb 2026). METR considera que la estimación central es una señal poco confiable del impacto actual.
Honestidad intelectual: el resultado de 2025 no era la palabra final. Los datos nuevos apuntan a aceleración, pero ambos intervalos incluyen ausencia de efecto y el propio diseño tiene sesgos importantes. La lección no es “la IA acelera” ni “la IA frena”. La consecuencia práctica es medir en el contexto propio: tiempo total, calidad, revisión, integración y retrabajo.
Punto de control · votemos de nuevo

En METR 2025, expertos 19% más lentos con IA, creyendo ser 20% más rápidos.
¿Cuál es la lectura más defendible?

A. Las herramientas de 2025 todavía generaban código de mala calidad.

B. Los desarrolladores no sabían dar buenas instrucciones.

C. El costo de revisar e integrar superó el ahorro de escribir.

D. Con 16 participantes, el estudio no permite concluir nada.

30 segundos para pensar · comenten con su vecino/a · votamos todos a la vez

PREGUNTA BISAGRA. Avanzar en Mentimeter a la segunda pregunta. Dar 30 segundos de silencio, 30 segundos con la persona de al lado y pedir voto simultáneo A–D. Mostrar la distribución antes de explicar. Si falla la conexión, usar dedos (1=A … 4=D). Mapa de errores: A confunde capacidad con causa; el código era plausible, pero el costo estaba en revisarlo e integrarlo. B reduce el fenómeno a destreza individual; eran usuarios experimentados con libre elección de herramienta. C es la respuesta más defendible: el cuello de botella se desplazó aguas abajo. D confunde tamaño muestral con validez: una muestra pequeña ensancha el intervalo (+2% a +39%), pero no invalida el diseño aleatorizado. Si domina C, avanzar. Si hay dispersión, explicar en 60 segundos dónde se fue el tiempo.
Productividad · 3/3

Escribir código no es lo mismo que ponerlo en producción

Diferencia entre generar código y publicarlo Tras adoptar herramientas de IA, los commits aumentan 180 por ciento, los proyectos 50 por ciento y las versiones publicadas 30 por ciento. Con agentes síncronos se producen siete veces más líneas, pero las versiones publicadas suben solo 20 por ciento. Efecto de adoptar herramientas de IA (>100.000 desarrolladores de GitHub) +180% +50% +30% Commits Proyectos Versiones publicadas Con agentes síncronos: 7× más líneas +20% versiones publicadas
Demirer, Musolff y Yang (2026), "Writing code versus shipping code", CEPR/VoxEU.
La generación crece con fuerza (+180% en commits; 7× más líneas con agentes), pero lo que llega a producción crece mucho menos (+30% y +20% en versiones publicadas, según la comparación). El trabajo se desplaza hacia revisión, integración, pruebas y publicación. Frase para dejar instalada: la IA no elimina el flujo productivo; lo desbalancea.
Adopción

Adopción masiva, valor concentrado

Brecha entre adopción de IA y captura de valor El 88 por ciento de las organizaciones usa IA, 39 por ciento reporta efecto en resultados operacionales y cerca de 6 por ciento captura la mayoría del valor. 88% 39% ~6% Organizacionesque usan IA Efecto en resultadooperacional Capturan la mayoríadel valor La brecha entre usar IA y capturar valor (encuestas globales 2025–2026)
McKinsey, The State of AI (2025/2026); Stanford HAI AI Index 2026. Gartner: 40% de las aplicaciones empresariales tendrán agentes a fines de 2026 y >40% de estos proyectos serán cancelados hacia 2027.
La división real no es quién tiene IA, sino quién rediseña procesos, métricas y verificación. El grupo que captura más valor no se distingue solo por el modelo: rediseña flujos de trabajo, gobierna los datos y define indicadores. La adopción puede crecer al mismo tiempo que fracasan muchos proyectos. La herramienta no es el único factor limitante.
El nuevo flujo

El flujo en cinco movimientos

1

Especificar

Problema, criterios de éxito y restricciones.

2

Contextualizar

Datos, documentación, ejemplos y reglas reutilizables.

3

Delegar

Tareas acotadas a uno o varios agentes.

4

Verificar

Pruebas, evaluación y revisión de supuestos.

5

Consolidar

Flujo productivo, reporte o herramienta durable.

Si falla la verificación: volver al contexto y a la especificación

Puente con Cristian Especificar + contextualizar → explorar Delegar → ejecutar Verificar → revisar Consolidar → finalizar

Preparar el contexto se vuelve tan importante como preparar los datos.

Síntesis propia de lo que documentan OpenAI, Anthropic y Google. ANUNCIAR LA CADENA aquí: "para llegar a la pregunta que importa — qué delego, qué hago en conjunto, qué retengo — vamos a responder tres preguntas más simples primero: qué se delega y quién verifica; qué necesita el agente y qué pasa si nadie lo mantiene; y dónde va la verificación". Cada slide siguiente responde una (encadenamiento explícito: reduce la distancia hasta la pregunta compleja). Los movimientos 1, 2 y 4 son donde vive el criterio — y son humanos. Explicar el puente visible: Cristian retomará este recorrido como cuatro fases operativas — explorar, ejecutar, revisar y finalizar — y mostrará las piezas que dejan evidencia en cada una. El resto del día recorre exactamente esto: Alonso con Codex, especialmente delegar y verificar; Cristian con skills, agentes, handoffs, harnesses y gates para volver el flujo reproducible y trazable. Dato de contexto de OpenAI interno: 99,8% de los tokens internos vienen de Codex; ~25% de los usuarios ya delega tareas de más de 8 horas; crecimiento 137x en usuarios NO desarrolladores (arXiv 2606.26959). Nuevos objetos de trabajo: AGENTS.md, skills, harnesses, evals.
La cadena · ¿qué se delega y quién verifica?

Netflix: delegar la ejecución, retener la hipótesis

Flujo humano-agente de Netflix para inferencia causal La persona principal define el marco causal, variables de confusión y criterios de validez. Un agente actor ejecuta extracción y análisis. Un agente crítico contrasta resultados y exige correcciones. La persona revisa y decide. Principal (humano) define el marco causal, las variables de confusión, los criterios de validez responsabilidad epistemológica Actor (agente) ejecuta extracción y análisis, implementa las técnicas estadísticas, genera notebooks y diagnósticos Crítico (agente) contrasta resultados con el plan, identifica lagunas lógicas, exige correcciones el humano revisa y decide
Netflix TechBlog, “A Human-Augmenting Agentic Workflow for Causal Inference” (8 jun 2026). Caso interno; evaluación pública adicional en datos sintéticos ACIC.
Este caso es análisis de datos, no ingeniería de software: inferencia causal con datos observacionales. Se delegan la ejecución estadística, los diagnósticos y análisis de sensibilidad. El humano conserva la pregunta, los supuestos, los factores de confusión y la decisión final. Un segundo agente revisa el proceso, pero no reemplaza la responsabilidad humana. Netflix también reporta una evaluación pública en datos sintéticos ACIC; esa evaluación no prueba desempeño general en datos reales.
La cadena · ¿qué necesita el agente — y qué pasa si nadie lo mantiene?

El contexto es el activo — y se deprecia

Efecto del conocimiento procedimental en el agente de datos de Anthropic La precisión es 21 por ciento sin guías de dominio, sube a 95 por ciento con conocimiento procedimental y cae a 65 por ciento después de un mes sin mantenimiento. Precisión del agente interno de análisis de datos de Anthropic 21% 95% 65% Sin guíasdel dominio Con conocimientoprocedimental Un mes sinmantenimiento
Anthropic, “How Anthropic enables self-service data analytics with Claude” (3 jun 2026). Caso interno del proveedor: 95% de consultas automatizadas con ~95% de precisión agregada.
En las evaluaciones internas de Anthropic, la precisión no superaba 21% sin guías que codificaran el conocimiento del dominio. Con esas guías superó 95% de forma agregada. Sin mantenimiento, cayó de cerca de 95% a cerca de 65% en un mes porque cambiaron modelos y definiciones. Es telemetría del propio proveedor, no un estudio independiente. La lección es operativa: el contexto útil debe mantenerse junto con los datos y transformaciones.
La cadena · ¿dónde va la verificación?

Por qué la verificación intermedia no es opcional

Confiabilidad compuesta de una cadena de pasos Si cada paso tiene 95 por ciento de probabilidad de éxito, la confiabilidad del flujo disminuye de forma exponencial. Después de 10 pasos queda cerca de 60 por ciento y después de 20 pasos cerca de 36 por ciento. Confiabilidad de una cadena de pasos con 95% de éxito por paso (0,95ⁿ) 100% 50% 10 pasos → 60% 0 10 pasos 20 pasos
Aritmética del fallo compuesto. Mitigaciones: cadenas cortas, validación intermedia, herramientas que pueden repetirse sin duplicar efectos y registro de estado.
Un agente que acierta 95% por paso parece confiable en la demo. Encadenados 10 pasos: 60% de confiabilidad del flujo completo. Esta aritmética explica por qué Gartner proyecta >40% de proyectos agentic cancelados hacia 2027, y por qué las arquitecturas que funcionan (DS-STAR, Netflix) meten verificación ENTRE pasos, no solo al final. Diseñar dónde van los puntos de verificación: trabajo de criterio, imposible de delegar del todo.
La cadena · la pregunta final

Colaborar no siempre gana: cuándo sí

Metaanálisis de 106 experimentos, 370 tamaños de efecto (Nature Human Behaviour):

en promedio, humano+IA rinde peor que el mejor de los dos por separado (g = −0,23).

Pierde en tareas de decisión (la IA ya supera al humano y la persona interviene de más).

Gana en tareas de creación, cuando cada parte aporta una fortaleza distinta dentro de la misma tarea.

La pregunta profesional deja de ser
"¿uso IA o no?"

y pasa a ser
"¿qué delego por completo, qué hago en conjunto y qué retengo?"

Vaccaro, Almaatouq y Malone (2024), Nature Human Behaviour 8, 2293–2303.
CIERRE DE LA CADENA: recapitular en una frase las tres respuestas construidas (se delega la ejecución con verificación; el agente necesita contexto mantenido; la verificación va entre pasos) y recién entonces plantear la pregunta final — la sala ya tiene las piezas para responderla. Este resultado sorprende a casi todos: la colaboración humano-IA NO es gratis. Cuando la IA ya es mejor en la subtarea (muchas decisiones de clasificación), el humano en el loop RESTA. Cuando la tarea tiene componentes complementarios (creación, análisis con contexto de negocio), la combinación gana. Diseñar esa partición — automatizar lo acotado, colaborar donde hay complementariedad, retener lo crítico — es una competencia profesional en sí misma. Es exactamente el criterio que el MDS tiene que formar.
Implicaciones · 1/2

El primer peldaño se estrecha — y el atajo cobra caro

−13%

empleo relativo de 22–25 años en ocupaciones más expuestas a IA (datos administrativos de nómina, EE.UU.); estabilidad en trabajadores con experiencia

los roles junior expuestos a IA tienen 7 veces más probabilidad de exigir habilidades tradicionalmente sénior (PwC, mil millones de avisos, 27 países)

Aprender con IA: importa cómo se usa

Experimento aleatorizado: grupo con IA 50% en la prueba; grupo sin IA 67%.

Análisis exploratorio: delegación total, <40%; patrones orientados a comprender, ≥65%.

Regla para aprender: pide explicaciones, predice el resultado, depura errores y comprueba que puedes justificar la solución sin ayuda.

Stanford (nóminas, 2025); PwC Global AI Jobs Barometer 2026; Anthropic, experimento con 52 desarrolladores (29 ene 2026). Los patrones de interacción son asociaciones, no efectos causales.
La contracción junior se expresa como menor crecimiento relativo y contratación plana, no como despidos masivos. En el experimento de Anthropic, usar IA redujo 17 puntos el dominio inmediato frente a programar sin IA. El desglose por patrones de uso fue exploratorio: delegar por completo se asoció con resultados bajos; pedir explicaciones, formular preguntas conceptuales y resolver errores se asoció con resultados altos. No afirmar que esos patrones causan por sí solos la diferencia. Para estudiantes: usar IA para comprender y verificar, no solo para terminar antes.
Implicaciones · 2/2

Chile: talento de sobra, escalamiento pendiente

Indicadores de inteligencia artificial en Chile Chile obtiene 70,5 puntos en el índice general y 95 en gobierno digital, pero 39,3 en adopción industrial. Solo 3,6 por ciento de los proyectos llega a flujos centrales. ILIA 2025 (CENIA/CEPAL) — Chile, país "pionero" en IA de América Latina 70,5 95 39,3 3,6% Índice general Gobierno digital Adopción industrial Proyectos escalados
ILIA 2025, CENIA/CEPAL (19 países). Escalamiento: MAS Analytics 2026 (~30% adopta, 3,6% escala a flujos centrales).
El cierre local. Chile lidera la región: primer lugar en alfabetización en IA, talento avanzado, 15% de la capacidad de datacenters de LatAm. Pero la adopción industrial es CRÍTICA: 39,3 puntos, puesto 12 de 19; y de las empresas que adoptan, solo 3,6% escala a flujos centrales. Es la brecha global (adopción vs valor) en versión local y más aguda. Traducción para esta sala: el problema de Chile no es falta de talento ni de herramientas — es exactamente lo que este taller entrena: rediseñar flujos con criterio, contexto y verificación. Los que están aquí son los que pueden cerrar esa brecha.

Síntesis: el criterio profesional es el recurso escaso

Síntesis

No es que programar deje de importar.
Importa como sustrato de algo superior.

Lo que escasea — y lo que este magíster forma — es la capacidad de definir problemas, empaquetar contexto, diseñar evaluaciones, decidir qué delegar y asumir responsabilidad por el resultado.

especificarcontextualizardelegarverificarconsolidar
Cerrar la tesis refinada: el cuello de botella se trasladó del código a especificación + contexto + verificación + mantenimiento del conocimiento. Los fundamentos (estadística, inferencia causal, evaluación) valen MÁS en este mundo, no menos: sin ellos no se puede verificar ni dirigir agentes.

Votación final y paso a la práctica

Antes de pasar a la práctica · votemos de nuevo

"Hoy soy más rápido/a en mi trabajo con datos de lo que era hace un año."
¿Mantienen su voto?

1 Totalmente de acuerdo · 2 De acuerdo · 3 Indeciso/a · 4 En desacuerdo · 5 Totalmente en desacuerdo

En el estudio METR de 2025, los desarrolladores
creían ser 20% más rápidos.
La medición mostró 19% más de tiempo.

La única forma de saber qué aportan estas herramientas a tu flujo es usarlas con método y medir.

Ahora Alonso la pondrá a prueba con Codex. Cristian cerrará mostrando cómo aceptar el resultado con evidencia.

dataScience UDD 10 años
Instituto de Data Science UDD · 10 años
Gracias — Germán Gómez · [email protected]
Instituto de Data Science UDD
RE-VOTO. Avanzar en Mentimeter a la votación final con la misma escala del 1 al 5. Dar 15 segundos, mostrar el resultado y compararlo con la distribución inicial. Preguntar a una o dos personas: "¿Cambiaste de número? ¿Qué evidencia influyó?". Si falla la conexión, repetir la escala con dedos. No importa la dirección del cambio; el aprendizaje visible es distinguir percepción de medición. Remate: no les pido que me crean, les pido que midan. Mencionar Build Week como oportunidad secundaria. TRANSICIÓN: "Mi tesis es que el criterio se volvió el recurso escaso. Alonso mostrará cómo delegar y verificar tareas reales con Codex; Cristian cerrará mostrando la arquitectura necesaria para que esos resultados no solo parezcan listos, sino que sean reproducibles, trazables y defendibles". PUENTE SUGERIDO PARA CRISTIAN: "Germán mostró dónde queda nuestro aporte y Alonso mostró la ejecución. Ahora veremos qué debe existir para poder decir ‘listo’ con evidencia".

Cómo navegar

Usa los controles, el teclado o los gestos táctiles durante la presentación.

/
Lámina anterior o siguiente
Espacio
Avanzar
Inicio / Fin
Primera o última lámina
N / notas
Mostrar u ocultar notas del orador
R / lectura
Alternar entre la lámina y una versión de lectura
Deslizar
Cambiar de lámina en una pantalla táctil
F
Entrar o salir de pantalla completa
?
Abrir o cerrar esta ayuda
Esc
Cerrar la ayuda o salir de pantalla completa