Los asistentes de IA que responden preguntas de negocio en lenguaje natural están pasando de los proyectos piloto a las manos de los directivos. Su atractivo es la velocidad: la respuesta llega en el mismo minuto en que se hace la pregunta, sin esperar a un analista. Pero la velocidad no es lo que la dirección recuerda. Recuerda el día en que el asistente dio una cifra de ingresos que no coincidía con la carpeta del consejo.
Una sola cifra equivocada puede deshacer meses de trabajo de adopción, porque pone en duda todas las demás respuestas. La solución no es frenar al asistente. Es demostrar, antes de que llegue a la dirección y después de cada cambio, que sus respuestas coinciden con las cifras certificadas.
Parta de la cifra certificada
Una cifra certificada es una cifra que la organización ha aceptado respaldar: conciliada con la fuente, construida sobre una definición que tiene un responsable y publicada en los reportes que la dirección ya utiliza. Esa cifra, y no la aritmética propia del asistente, es la referencia. El asistente acierta solo cuando reproduce la cifra certificada con la misma definición, el mismo periodo y el mismo alcance.
Cuando no existe una cifra certificada para una pregunta, el asistente debe decirlo y explicar qué usó en su lugar. Un “esta no es una medida certificada”, dicho con honestidad, protege la confianza mucho mejor que una suposición planteada con total seguridad.
Construya un set de prueba con preguntas reales
El set de prueba es una lista de preguntas con sus respuestas esperadas; pocas cosas en un proyecto de analítica con IA valen tanto. Constrúyalo a partir de lo que la dirección realmente pregunta: preguntas enviadas a los analistas, planteadas en reuniones de revisión o escritas en el asistente durante el piloto. Cada caso de prueba registra cuatro elementos.
- La pregunta, redactada como la gente la hace, con algunas reformulaciones y la pregunta de seguimiento natural.
- La respuesta esperada, tomada del reporte certificado, con su periodo, alcance y unidad.
- La fuente que la respuesta debe citar, para que una cifra correcta tomada del lugar equivocado también falle.
- El responsable que confirma la respuesta esperada y la actualiza cuando cambia una definición.
Incluya preguntas que el asistente debe declinar: periodos que aún no se cierran, datos fuera de su alcance e información que la persona que pregunta no tiene permitido ver. Declinar correctamente cuenta como acierto. Unas cuantas decenas de preguntas bien elegidas por tema son mejor punto de partida que cientos de preguntas genéricas.
Ejecútelo con cada cambio
Un set de prueba que se usa una sola vez, en el lanzamiento, es una demostración. Su valor está en ejecutarlo automáticamente cada vez que algo cambia: el modelo semántico, una medida, las instrucciones del asistente, el modelo de IA subyacente o incluso el nombre de una columna. Los cambios que parecen inofensivos suelen ser los que alteran las respuestas, porque el asistente lee nombres y descripciones para decidir qué significa una pregunta.
Fije un umbral de liberación con el responsable de negocio y trátelo como cualquier otro control de calidad. Un cambio que lleva la precisión por debajo del umbral no llega a los usuarios hasta que se corrige. Ejecute el set completo antes de cada liberación y uno más corto todos los días, porque los datos también cambian. Conserve cada ejecución para poder mostrar cómo ha evolucionado la precisión con el tiempo.
Acuerde primero las tolerancias
No toda diferencia es un error, y discutirlo después de una falla hace perder tiempo. Acuerde las tolerancias con finanzas antes de la primera ejecución. Los conteos y las transacciones deben coincidir exactamente. Los montos solo pueden diferir por redondeo, con la precisión que muestra el reporte certificado. Las razones financieras deben usar la definición certificada, no un recálculo hecho a partir de cifras redondeadas.
La redacción puede variar; las cifras, los periodos y las definiciones, no. Una respuesta que cita ingresos brutos cuando la pregunta era sobre ingresos netos es incorrecta, por bien redactada que esté. Cuando una pregunta es ambigua, el asistente debe explicitar su supuesto o preguntar, y el set de prueba debe verificar que lo hizo.
Cuando el asistente se equivoca
Trate una respuesta equivocada como trataría un error en un reporte publicado: como un defecto con una causa, un responsable y una corrección. Las causas suelen ser conocidas: dos medidas con nombres parecidos, una descripción faltante, un filtro que el asistente no aplicó o una pregunta fuera de los datos que puede ver.
Corrija la causa en el modelo o en las instrucciones en lugar de parchar esa única respuesta, y agregue la pregunta fallida al set de prueba para que el mismo error no pueda volver sin que nadie lo note. Mientras se corrige, acote el alcance del asistente: canalice las preguntas sobre ese tema a un analista y explique a los usuarios qué cambió. La gente perdona mucho más fácilmente un límite conocido que un error silencioso.
Muestre la fuente en cada respuesta
Cada respuesta debe indicar su procedencia: el reporte o modelo certificado del que proviene, la medida utilizada, el periodo y los filtros aplicados y la fecha de la última actualización de los datos, con un vínculo a la página donde se puede verificar la cifra. Las respuestas basadas en datos no certificados deben decirlo con claridad.
Mostrar la fuente hace más que generar confianza. Hace visibles los errores rápidamente, porque los lectores notan de inmediato cuando el periodo o el alcance no es lo que preguntaron. Y el asistente solo debe ver lo que la persona que pregunta tiene permitido ver, para que cada respuesta siga las mismas reglas de acceso que el reporte del que proviene.
En conclusión
La velocidad es la promesa de la IA en la analítica; la confianza es la condición para usarla. Las organizaciones que tratan las respuestas esperadas como un activo gobernado, a cargo de finanzas y del equipo de analítica en conjunto, y que ejecutan el set de prueba con cada cambio, pueden ampliar un asistente tema por tema, con evidencia en cada paso. Las que se saltan el set de prueba se enteran de sus errores por boca de su propia dirección, que es la forma más costosa de aprender.