Post Thumbnail

Prueba de Salesforce: Gemini 2.5 Pro resuelve solo 58% de tareas empresariales

La prueba Salesforce CRMArena-Pro muestra que incluso los modelos líderes de inteligencia artificial enfrentan limitaciones serias al resolver tareas empresariales cotidianas.

Imaginen: el modelo insignia Gemini 2.5 Pro maneja exitosamente solo 58% de las consultas con una sola solicitud. ¿Y qué pasa con el diálogo de múltiples etapas? ¡La eficiencia cae rápidamente al 35%!

CRMArena-Pro prueba grandes modelos de lenguaje bajo condiciones reales de ventas, servicio al cliente y fijación de precios. Los investigadores crearon 4280 tareas únicas en 19 tipos de operaciones empresariales usando datos sintéticos de Salesforce.

Particularmente reveladores son los resultados en el área de diálogos de múltiples etapas — un elemento clave de cualquier interacción empresarial. Casi la mitad de los intentos fallidos de Gemini 2.5 Pro está relacionada con la incapacidad de solicitar información críticamente importante. Los modelos que hacen más preguntas aclaratorias demuestran resultados significativamente mejores.

El mayor rendimiento se logró en la automatización de flujos de trabajo simples — 83% de éxito en el enrutamiento de solicitudes de servicio de soporte. Sin embargo, las tareas que requieren comprensión profunda del texto o seguir reglas complejas siguen siendo un desafío serio para las tecnologías modernas de inteligencia artificial.

Autor: AIvengo
Latest News
Jefe de Nvidia cree que no hay burbuja de IA

Fundador de Nvidia Jensen Huang disipó preocupaciones sobre burbuja en mercado de IA. Y según él, últimos chips de compañía se espera que traigan 0.5 billones de dólares en ingresos.

Sam Altman está cansado de preguntas sobre dinero

Sam Altman está cansado de preguntas sobre dinero de OpenAI. Y esto se hizo obvio durante entrevista conjunta con Satya Nadella en podcast Bg2.

Número de vacantes de ingenieros de despliegue avanzado creció 800%

Compañías de IA inventaron nueva profesión. Hablamos de ingenieros de despliegue avanzado.

OpenAI promete crear científico de IA completo para 2028

OpenAI prometió crear científico basado en IA completo para 2028. CEO de compañía Sam Altman también declaró que sistemas de aprendizaje profundo podrán realizar funciones de científicos investigadores a nivel de pasante para septiembre de próximo año. Y nivel de investigador de IA autónomo completo podría alcanzarse para 2028.

Empleos para jóvenes especialistas IT en Gran Bretaña colapsaron 46%

¿Saben qué está pasando en mercado laboral para jóvenes especialistas IT en Gran Bretaña? Durante último año, número de empleos para jóvenes especialistas colapsó 46%. Y se pronostica caída adicional de 53%, reporta The Register. Citando estadísticas de Institute of Student Employers.