Post Thumbnail

Prueba de Salesforce: Gemini 2.5 Pro resuelve solo 58% de tareas empresariales

La prueba Salesforce CRMArena-Pro muestra que incluso los modelos líderes de inteligencia artificial enfrentan limitaciones serias al resolver tareas empresariales cotidianas.

Imaginen: el modelo insignia Gemini 2.5 Pro maneja exitosamente solo 58% de las consultas con una sola solicitud. ¿Y qué pasa con el diálogo de múltiples etapas? ¡La eficiencia cae rápidamente al 35%!

CRMArena-Pro prueba grandes modelos de lenguaje bajo condiciones reales de ventas, servicio al cliente y fijación de precios. Los investigadores crearon 4280 tareas únicas en 19 tipos de operaciones empresariales usando datos sintéticos de Salesforce.

Particularmente reveladores son los resultados en el área de diálogos de múltiples etapas — un elemento clave de cualquier interacción empresarial. Casi la mitad de los intentos fallidos de Gemini 2.5 Pro está relacionada con la incapacidad de solicitar información críticamente importante. Los modelos que hacen más preguntas aclaratorias demuestran resultados significativamente mejores.

El mayor rendimiento se logró en la automatización de flujos de trabajo simples — 83% de éxito en el enrutamiento de solicitudes de servicio de soporte. Sin embargo, las tareas que requieren comprensión profunda del texto o seguir reglas complejas siguen siendo un desafío serio para las tecnologías modernas de inteligencia artificial.

Autor: AIvengo

Latest News

Imagry creó un dron sin mapas HD

La empresa Imagry creó una tecnología única de control autónomo que funciona sin mapas HD. Esta maravilla de ingeniería se basa en un enfoque bio-inspirado que imita la percepción y toma de decisiones humanas. Imaginen — ¡el sistema ve la carretera con ojos-cámaras y toma decisiones con un cerebro-red neuronal, exactamente como un conductor experimentado!

El Ministerio estadounidense reemplazó silenciosamente reporte con citas falsas de IA

El reporte del Ministerio de Salud y Servicios Sociales de Estados Unidos sobre enfermedades crónicas infantiles se encontró en el centro de un escándalo científico. Los expertos descubrieron que el documento "Make Our Children Healthy Again Assessment" contiene citas falsificadas e investigaciones inexistentes.

La IA de Meta bloquea miles de grupos de Facebook por "terrorismo"

Antes les conté que la inteligencia artificial de Meta estaba bloqueando masivamente cuentas de Instagram. Ahora también está bloqueando grupos de Facebook. Está ocurriendo una ola de bloqueos sin precedentes. Miles de grupos de Facebook cayeron bajo sanciones infundadas del sistema de moderación. Este colapso técnico afectó comunidades tanto en Estados Unidos como en el extranjero, abarcando las categorías temáticas más diversas.

Google lanzó Gemini CLI: agente de IA para código

La empresa Google presentó Gemini CLI. Este es un agente oficial para usar inteligencia artificial para escribir código. Directamente desde la línea de comandos. Y esta herramienta da acceso a todas las capacidades del modelo Gemini 2.5 Pro.

Prueba de Salesforce: Gemini 2.5 Pro resuelve solo 58% de tareas empresariales

La prueba Salesforce CRMArena-Pro muestra que incluso los modelos líderes de inteligencia artificial enfrentan limitaciones serias al resolver tareas empresariales cotidianas.