Tres chatbots distintos, la misma falla de fondo

Imagen ilustrativa: Tres chatbots distintos, la misma falla de fondo

No todos fallan igual

Un chatbot con IA puede parecer una solución rápida: se activa, responde y da la sensación de que el problema está resuelto; pero en la práctica aparece una diferencia clara entre tener "algo que contesta" y tener un asistente que sostiene una conversación en nombre de la empresa.

Esa diferencia es operativa.

Se explica por hasta dónde llega lo que se construyó encima del modelo (chatGPT u otro), no por el modelo que hay debajo. Hay tres formas típicas de quedarse corto.

El enlatado

Es el que se implementa en minutos. Empieza a responder desde el primer día, pero no sabe quién es la empresa ni cómo funciona. Tiene el modelo y nada más.

No distingue entre una consulta de rutina y un caso que debería haber pasado a una persona. No reconoce matices. Responde igual a todo: arma frases correctas en apariencia pero sin relación con la situación real de quien escribe.

No tiene forma de saber cuándo no debería responder, cuándo debería pedir más contexto, o cuándo está frente a algo que requiere otro tratamiento: se equivoca sin poder notarlo.

Quien lo consulta porque algo de lo que compró no anda, recibe una explicación general que no aplica a su caso. Vuelve a escribir, esta vez molesto, y ahora sí lo atiende una persona, que arranca leyendo todo el intercambio anterior para descartarlo. El trabajo que el sistema iba a ahorrar aparece igual, más tarde y peor.

El semi-personalizado

Con el semi-personalizado (que se suele presentar como "personalizado") hay cierto avance. Reconoce términos del rubro, entiende algunas consultas frecuentes y mantiene coherencia en las respuestas típicas. Aprendió el vocabulario de la empresa, no su operación.

Por eso responde bien en escenarios previsibles y se desordena cuando la conversación se sale del guion. Ahí aparece una zona difícil de detectar: respuestas que parecen razonables y no lo son. No hay errores evidentes, pero tampoco criterio suficiente para sostener la conversación cuando la situación es ambigua.

Ese tipo de error es más costoso que el anterior porque no suele ser visible, y cuando se acumula deteriora la experiencia sin que haya un punto claro donde intervenir.

El conectado a los documentos

Es el que hoy se presenta como la implementación seria y el que muchas empresas ya tienen. Se le carga la documentación (manuales, procedimientos, respuestas anteriores) y el sistema busca ahí antes de contestar. Por primera vez la información que devuelve es la de la empresa.

Y aun así falla, aunque de una manera nueva: tiene el material pero no la decisión. Encuentra los fragmentos que se parecen a lo que se preguntó y los devuelve, sin evaluar si eso era lo que hacía falta en ese momento. Contesta con precisión la pregunta equivocada. Explica de más cuando solo había que confirmar un dato. Sigue el hilo del documento en lugar del hilo de la conversación.

Es la falla más difícil de discutir internamente, porque cada respuesta, mirada por separado, está bien. El problema aparece en el conjunto: el equipo termina revisando todos los casos, por las dudas. El sistema no reemplazó ese trabajo, le agregó un paso.

Diagnóstico Operativo · ConverseCraft

Criterio y lógica para resolver tareas en la empresa. Tanto si llegás con una traba operativa concreta como si todavía estás explorando el tema, planteá una situación de trabajo y avanzá desde ahí.

Analizá tu caso →

Por qué los tres se quedan cortos

El enlatado tiene el modelo y nada más. El semi-personalizado le suma instrucciones fijas: un tono, un vocabulario, respuestas que se repiten iguales para las mismas preguntas. El conectado a los documentos suma además el material de la empresa, cargado de antemano e igual para quien pregunte. Cada uno construye sobre el anterior, y sin embargo ninguno decide.

Lo que le falta a los tres no es algo que se agregue por encima, como una pieza más en la torre: es algo que atraviesa a los tres y los hace rendir, algo que resuelva qué está pasando antes de generar devolver una palabra al usuario: si esto es una consulta o un reclamo, si conviene responder o preguntar, si hay que dar el dato completo o frenar y derivar. Esa decisión hace valer lo demás: con el material de la empresa bien cargado lo hace rendir, buscando lo que corresponde en vez de lo que se parece; con poco material igual decide bien, porque ahí lo que pesa es el criterio con que se usa lo poco que hay.

Un asistente construido así no improvisa, puede manejar ambigüedad, sostener coherencia a lo largo de una conversación y actuar con consistencia frente a casos parecidos. En ese punto deja de ser un experimento y pasa a cumplir un rol operativo.

Qué determina el resultado

Muchas implementaciones fallan por una suposición implícita: que el comportamiento del sistema depende principalmente del modelo que se utiliza.

Lo que determina el resultado es otra cosa: cómo se interpreta cada situación, cómo se estructura la conversación y qué se decide hacer antes de responder.

Sin esa capa, cualquier sistema, incluso uno basado en modelos avanzados como los de OpenAI o los de Anthropic, queda limitado a generar texto sin criterio. Y cuando eso ocurre, el chatbot expone a la empresa en vez de representarla.

Lo que termina comunicando

Cada chatbot transmite, sin proponérselo, una forma de operar. Si responde sin contexto, la empresa parece desordenada; si encima es inconsistente entre un mensaje y el siguiente, parece poco confiable. Cuando responde con criterio, en cambio, eso también se nota.

Lo que importa es si hay algo, entre el mensaje que entra y la respuesta que sale, que decida qué corresponde hacer. Cuando no lo hay, el sistema devuelve texto y el trabajo de interpretar aterriza a la mesa de alguien. Y eso es lo que termina definiendo si suma o resta en la operación diaria.