Agentes

Microsoft publica una prueba que juzga a los agentes por lo que dejan en la base de datos, no por lo que dicen

Microsoft y Hugging Face publicaron el 3 de octubre ThinkingBox, una prueba que califica a los agentes por los registros que dejan detrás, no por las frases que generan, y que pregunta además si pueden repetirlo veinte veces seguidas. Cubre 507 flujos de trabajo empresariales con estado, cada uno ejecutado 20 veces contra distintos modelos, y puntúa el estado final del sistema y los efectos secundarios. Cada repetición arranca desde un sistema limpio idéntico, y está disponible a través de Hugging Face.

LanzamientoDisponibleSin confirmar si afecta al plan gratuito

Qué significa para ti

El dato que justifica el enfoque: de 121.680 intentos válidos sobre 12 modelos, 79.853 fallaron las comprobaciones, y de esos fallos el 67,24 % terminó limpiamente, llamó a una herramienta que cambiaba el estado y no devolvió ningún error. Dicho de otro modo: dos de cada tres fallos parecían un éxito. Encontraron valores equivocados en el 77,61 % y efectos de más en el 43,30 %. El código va con licencia MIT y los datos con CDLA-Permissive-2.0, y ellos mismos avisan de que cada tarea pública es una reconstrucción sintética y los clientes no son reales.

Fuentes

Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.

Seguir leyendo

  • Agentes

    ComfyUI estrena un agente que monta y arregla los flujos de trabajo, en beta y de momento sólo en su nube

    Comfy presentó el 1 de octubre Comfy Agent, un agente que vive dentro de ComfyUI: se le describe lo que se quiere y él construye, ejecuta e itera los flujos de trabajo a la vista del usuario. Está disponible para todo el mundo en Comfy Cloud y llegará a Comfy Desktop en unas semanas. Trabaja sobre el mismo lienzo mientras el usuario edita, admite skills públicas o privadas y hasta cinco conversaciones en paralelo, y la compañía insiste en que todos los controles de ComfyUI siguen ahí, nodo por nodo.

    Preview o betaPreview

  • Agentes

    LlamaIndex sube la precisión de su extractor de documentos y dice que sin tocar el precio por página

    LlamaIndex publicó el 1 de octubre Extract v2.5, una generación nueva de sus agentes de extracción de documentos por esquema. Trae mejoras de precisión en los tres niveles y más capacidad de anclar los valores en su fuente en los dos más altos, Agentic y Agentic Plus. Dice que llegan sin subir el precio por página. Por debajo hay un andamiaje de agente nuevo, hecho a propósito para extraer de documentos e inspirado, cuentan, en los agentes de programación.

    ActualizaciónDisponible

  • Agentes

    Gemini estrena «skills» y jubila los Gems: en las cuentas personales dejan de funcionar a partir de noviembre

    Google empezó a repartir el 30 de septiembre las «skills» en el chat de Gemini a escala global: instrucciones guardadas que se reutilizan escribiendo una barra y su nombre en la barra de la petición. Ya estaban en Gemini Spark y vienen a sustituir a los Gems. Se pueden combinar varias a la vez, Gemini puede construirlas a partir de las conversaciones y ejecutarlas al detectar una petición que encaje, y desde ese día pueden incluir ficheros de referencia: documentos de texto, PDF o imágenes.

    ActualizaciónDisponible