WIZNEOnewsletter
3 min

Los agentes útiles vienen con controles

Modelos más rápidos, agentes empresariales y datos conectados apuntaron al mismo lugar: el trabajo útil necesita permisos, fuentes, evaluación y revisión humana.

Los agentes útiles vienen con controles

Esta semana vi menos distancia entre un modelo rápido y un agente capaz de sostener trabajo largo. También vi a los proveedores hablar con más detalle sobre permisos, fuentes, pruebas y escalamiento humano.

Ese cambio me interesa porque mueve la conversación hacia la operación diaria. Ya puedo comparar cuánto razona un modelo, qué herramientas usa y en qué punto me devuelve una decisión.

Para mí, un agente se vuelve útil cuando puedo darle trabajo real sin entregarle control ilimitado.

Gemini 3.6 Flash lleva el modelo rápido a tareas más largas #

GitHub empezó a desplegar Gemini 3.6 Flash en Copilot el 21 de julio. Lo presenta para desarrollo web, aplicaciones y tareas agentic de mayor duración, con esfuerzo de razonamiento configurable y uso paralelo de herramientas.

Primero probaría el anuncio con una tarea conocida. Conservaría el mismo criterio de salida y compararía tiempo, costo, correcciones y pruebas. Un modelo rápido me sirve cuando mantiene la calidad necesaria para ese trabajo.

La parte práctica está en separar el flujo del modelo. Si documento entradas, herramientas, límites y revisión, puedo probar otra opción sin reconstruir toda la operación.

OpenAI Presence empieza cada agente con un trabajo delimitado #

Un agente empresarial consulta conocimiento limitado y solicita aprobación antes de actuar

OpenAI presentó Presence el 22 de julio para agentes empresariales de voz y chat. Cada despliegue empieza con un trabajo específico. La empresa define el conocimiento, el acceso, las políticas, las acciones aprobadas y el momento de escalar a una persona.

Para mí, esa secuencia vale más que la promesa de autonomía. Antes de conectar un agente a soporte, ventas u operaciones, yo escribiría el trabajo que debe resolver y las excepciones que regresan a una persona.

Presence sigue disponible de forma limitada para empresas elegibles y requiere acompañamiento de OpenAI o integradores seleccionados. Yo tomaría el patrón operativo sin confundirlo con un producto de autoservicio.

El Economic Index conserva la fuente y también su límite #

Anthropic lanzó el conector del Economic Index para Claude el 22 de julio. Permite preguntar con lenguaje natural qué ocupaciones usan más IA, qué tareas automatizan y cómo cambia el uso dentro de una industria.

Yo me quedo con la aclaración que acompaña las respuestas: el índice refleja patrones de uso de Claude, no todo el mercado laboral. Esa frontera evita convertir un conjunto de datos en una conclusión universal.

Aplicaría la misma regla a investigación, ventas y estrategia. Quiero que el agente enlace la fuente, distinga el dato de su inferencia y nombre lo que esa evidencia no permite concluir.

Opus 5 compite por verificar el trabajo antes de entregarlo #

Un flujo de trabajo compara costo, esfuerzo, pruebas y verificación antes de aceptar un resultado

Anthropic presentó Claude Opus 5 el 24 de julio. La empresa destaca mejoras en programación, trabajo de conocimiento y uso de computadora, junto con controles de esfuerzo para equilibrar capacidad, costo y velocidad.

Me interesa más el comportamiento de verificación que el ranking. Anthropic describe casos donde el modelo construyó pruebas, revisó una interfaz en escritorio y móvil, y encontró la causa de un error antes de cerrar la tarea. Son ejemplos del proveedor, así que yo los usaría como hipótesis para una prueba propia.

Mi evaluación tendría una salida verificable: pruebas que corren, enlaces que abren, cálculos reproducibles o una revisión visual. Si el agente no puede mostrar cómo comprobó el resultado, todavía me toca hacer esa parte antes de usarlo.

Con qué me quedo esta semana #

Los anuncios de esta semana me dejan una forma concreta de probar agentes: empiezo con un trabajo delimitado, conecto las fuentes necesarias, restrinjo herramientas y exijo evidencia antes de aceptar la salida.

Esta semana probaría una tarea repetitiva con dos modelos. Mantendría el mismo contrato y compararía calidad, costo, correcciones y tiempo. Después elegiría con los datos del flujo.

Nos leemos el próximo viernes.