
Prueba de Salesforce: Gemini 2.5 Pro resuelve solo 58% de tareas empresariales
La prueba Salesforce CRMArena-Pro muestra que incluso los modelos líderes de inteligencia artificial enfrentan limitaciones serias al resolver tareas empresariales cotidianas.
Imaginen: el modelo insignia Gemini 2.5 Pro maneja exitosamente solo 58% de las consultas con una sola solicitud. ¿Y qué pasa con el diálogo de múltiples etapas? ¡La eficiencia cae rápidamente al 35%!
CRMArena-Pro prueba grandes modelos de lenguaje bajo condiciones reales de ventas, servicio al cliente y fijación de precios. Los investigadores crearon 4280 tareas únicas en 19 tipos de operaciones empresariales usando datos sintéticos de Salesforce.
Particularmente reveladores son los resultados en el área de diálogos de múltiples etapas — un elemento clave de cualquier interacción empresarial. Casi la mitad de los intentos fallidos de Gemini 2.5 Pro está relacionada con la incapacidad de solicitar información críticamente importante. Los modelos que hacen más preguntas aclaratorias demuestran resultados significativamente mejores.
El mayor rendimiento se logró en la automatización de flujos de trabajo simples — 83% de éxito en el enrutamiento de solicitudes de servicio de soporte. Sin embargo, las tareas que requieren comprensión profunda del texto o seguir reglas complejas siguen siendo un desafío serio para las tecnologías modernas de inteligencia artificial.