top of page
cardiologist-doctor-surgeon-analyzing-patient-heart-testing-result-human-anatomy-interface

Agentes de IA en producción: lo que pasa el día 180, no el día 1

Foto del escritor: mobiik softwaresolution
mobiik softwaresolution
hace 1 día
6 min de lectura

El día del lanzamiento, casi cualquier agente de IA se ve bien. Los datos están frescos, el equipo está atento a cada respuesta, el alcance es acotado y la demo funciona. Es el día más fácil de toda la vida del agente.


Lo que casi ninguna empresa planea es el día 180. Para entonces el entusiasmo ya bajó, el equipo que lo construyó volvió a otros proyectos, el negocio cambió y nadie está mirando cada conversación. Ahí es donde se decide si el agente se convierte en parte de la operación o en otro piloto que se apagó sin que nadie lo anunciara.


El día 1 mide la tecnología. El día 180 mide la operación


Una implementación termina cuando el sistema se entrega y funciona. Una operación no termina nunca: es la responsabilidad continua de que ese sistema siga haciendo lo que se prometió, con la calidad que se prometió, cuando las condiciones ya no son las del día del lanzamiento.


Esa diferencia importa porque casi todo lo que puede salir mal con un agente aparece después de la entrega, no durante ella. Y los números del mercado lo confirman.


Lo que dicen los números


Gartner prevé que más de 40% de los proyectos de IA agéntica serán cancelados antes de que termine 2027, por costos que escalan, valor de negocio poco claro o controles de riesgo inadecuados. Según su análisis, la mayoría de estos proyectos hoy son experimentos o pruebas de concepto en etapa temprana, lo que puede ocultar el costo y la complejidad reales de operarlos a escala.


El patrón coincide con lo que encontró el reporte The GenAI Divide del MIT NANDA, basado en la revisión de más de 300 iniciativas públicas de IA, entrevistas con representantes de 52 organizaciones y encuestas a 153 líderes senior: 95% de las organizaciones no obtiene retorno de sus iniciativas de IA generativa, y solo 5% de las herramientas de IA empresariales personalizadas llega a producción.


Y desde adentro de los equipos que construyen agentes, la encuesta State of Agent Engineering de LangChain, una empresa que desarrolla herramientas para construir y evaluar agentes, con más de 1,300 profesionales, muestra que 57% ya tiene agentes en producción, pero que la calidad (precisión, consistencia, tono y apego a las políticas de la empresa) sigue siendo la principal barrera para llevar más agentes a producción, citada por 32% de los encuestados. Dicho de otra forma: llegar a producción es cada vez más común. Mantener la calidad una vez ahí es lo difícil.


Qué cambia entre el día 1 y el día 180


Un agente no falla como falla un servidor. Casi nunca se cae. Lo que ocurre es más silencioso: sigue respondiendo, pero responde un poco peor cada mes. Las razones suelen ser de cuatro tipos.


El negocio cambia. Nuevos productos, nuevas políticas, nuevos precios, nuevos procesos. Si el agente no se actualiza al mismo ritmo, empieza a dar respuestas que eran correctas hace tres meses.


Los usuarios cambian. Cuando un agente lleva meses disponible, la gente descubre formas de usarlo que nadie anticipó: preguntas fuera del guion, combinaciones de temas, casos límite que no estaban en ninguna prueba del lanzamiento.


Los modelos cambian. Los modelos de lenguaje que sostienen al agente se actualizan, y un cambio que mejora el promedio puede empeorar justo el caso que a esa empresa le importaba.


La atención cambia. El día 1 hay un equipo revisando. El día 180 hay un tablero que nadie abre. La mayoría de los problemas de un agente en producción no se descubren por una alerta, se descubren por la queja de un cliente.


Ver no es medir


Aquí hay un dato revelador de la misma encuesta de LangChain: cerca de 89% de los equipos ya implementó observabilidad en sus agentes, es decir, puede ver qué hizo el agente paso por paso. En cambio, 52% corre evaluaciones antes del lanzamiento, sobre conjuntos de prueba, y apenas 37% evalúa en línea lo que pasa con usuarios reales una vez que el agente está en operación.


Esa diferencia es el corazón del problema, porque el día 180 se juega justo en esa última cifra. Poder ver una conversación no es lo mismo que saber si fue buena. Un agente puede responder con total fluidez y total seguridad, y estar equivocado. Para detectarlo no basta con un tablero de actividad: hace falta compararlo contra un criterio que viene de afuera del propio agente, como una regla de negocio, una respuesta de referencia o el resultado real que se obtuvo.


Un equipo que solo observa se entera de los problemas cuando alguien se queja. Un equipo que evalúa se entera antes.


Qué significa monitoreo continuo en la práctica


Operar un agente de IA en producción implica un conjunto de prácticas que se repiten todos los días, no una revisión de vez en cuando:


Medir la calidad con indicadores de negocio, no solo de actividad. Cuántos casos resolvió de verdad, cuántos tuvo que escalar, cuántos se repitieron porque la primera respuesta no sirvió. El número de conversaciones atendidas es un indicador de uso, no de valor.


Evaluar contra un estándar definido. Casos de prueba con respuesta esperada, reglas de negocio que el agente no puede violar y revisiones periódicas de muestras de conversaciones reales, para detectar cuando la calidad empieza a bajar y no cuando ya es evidente.


Definir qué hace el agente cuando no está seguro. El peor comportamiento de un agente no es decir "no sé", es responder con la misma seguridad una pregunta que no domina. Un agente bien operado sabe cuándo pasar el caso a una persona, y lo hace con el contexto completo para que el cliente no tenga que repetir nada.


Poner límites claros a lo que puede hacer. A medida que un agente pasa de responder preguntas a ejecutar acciones, la pregunta deja de ser solo si responde bien y pasa a ser qué puede decidir, con qué permisos y quién aprueba qué. El framework AEGIS de Forrester parte justamente de ahí: plantea que los agentes no se pueden gobernar con los mismos controles que una aplicación tradicional o un copiloto, e incluye monitoreo de riesgo en tiempo real y detección automática de cambios en el comportamiento del agente.


Ajustar con evidencia, no por intuición. Cada cambio al agente debería poder medirse: si se modificó una instrucción, una fuente de información o un flujo, hay que saber si el resultado mejoró o empeoró. Sin eso, cada ajuste es una apuesta.


Tener a alguien responsable. Parece obvio, pero es lo que más falla. Cuando el proyecto "terminó", el agente se vuelve de todos y de nadie. Un agente en producción necesita un dueño con nombre y apellido, y un equipo con capacidad real de intervenir.


Cinco preguntas antes de lanzar, no después


La mejor forma de saber si una empresa está preparada para el día 180 es hacerse estas preguntas antes del día 1:


  1. ¿Quién va a revisar la calidad de lo que responde el agente, y con qué frecuencia?

  2. ¿Contra qué estándar se va a medir esa calidad?

  3. ¿Qué hace el agente cuando no sabe, y a quién le pasa el caso?

  4. ¿Cómo nos enteraríamos de que su desempeño bajó antes de que lo note un cliente?

  5. ¿Qué podemos cambiar sin volver a empezar, y quién decide hacerlo?


Si alguna respuesta es "lo vemos después", ya sabes dónde va a aparecer el problema.


La diferencia entre un piloto y una operación


Un piloto demuestra que algo puede funcionar. Una operación demuestra que sigue funcionando. Son dos trabajos distintos, con equipos, métricas y ritmos distintos, y confundirlos es la razón por la que tantas iniciativas de IA se quedan en el primer paso.

Las empresas que sacan valor sostenido de sus agentes no son necesariamente las que eligieron el modelo más avanzado. Son las que trataron el lanzamiento como el comienzo del trabajo y no como el final.


La pregunta que vale la pena hacerse


No es qué tan bien funciona tu agente hoy. Es qué tan seguro estás de que va a seguir funcionando igual de bien dentro de seis meses, y si hoy mismo existe alguien, y un proceso, para darse cuenta si no es así.


En Mobiik no implementamos y nos vamos. Operamos agentes de IA en producción como parte de tu operación, con monitoreo continuo, evaluación constante de la calidad, escalamiento a personas con contexto completo y gobierno de datos dentro de tu propio entorno tecnológico. Si quieres entender cómo se vería tu operación el día 180, conversemos.

 
 
bottom of page