Local y open source

Ollama estrena modelos de decisión que responden en la propia máquina, y uno de los tres es de código abierto

Ollama añadió el 29 de septiembre soporte para modelos de decisión, basados en la API Jev de TypeSafe. Está disponible desde la versión 0.35 mediante un endpoint nuevo, /v1/systemone: se le envía un texto como estado junto a un conjunto de preguntas con nombre y un modelo que corre en la propia máquina las responde todas en una sola petición. Lo presenta como decisiones rápidas y con tipos, sin coste adicional y con menos latencia al ejecutarlo en local, con tres modelos disponibles el mismo día.

ActualizaciónDisponibleSin confirmar si afecta al plan gratuito

Qué significa para ti

De los tres, nimble es de código abierto, tiene 9.000 millones de parámetros y lo ha hecho Bespoke Labs; tev1 y tev1:0.8b son experimentales de Together AI, de 4.000 y 800 millones. Ollama los propone para clasificar tickets, encaminar peticiones entre modelos y moderar contenido, tareas en las que la decisión tiene que llegar rápida más que brillante. Su propia medida: Nimble 9B promedió 91 milisegundos por decisión en un M5 Max. La comparativa que enseña no es suya, sino de Bespoke Labs, sobre 13 conjuntos públicos con etiquetas humanas y 3.880 decisiones.

Fuentes

Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.

Seguir leyendo

  • Local y open source

    Transformers ejecuta ya las cuantizaciones GGUF de llama.cpp, con la ruta rápida limitada a Apple Silicon

    Hugging Face publicó el 22 de septiembre el soporte para ejecutar modelos en formato GGUF dentro de transformers, el formato que desarrolló el equipo de llama.cpp y que se usa para inferencia local. Basta elegir un GGUF del Hub, cargarlo con from_pretrained indicando el fichero y generar en la propia máquina, sin configuración adicional. El mismo fichero sirve con transformers serve, que expone una API compatible con la de OpenAI. Por ahora hay que instalar transformers desde su rama principal, no desde una versión publicada.

    ActualizaciónPreview

  • Local y open source

    Hugging Face publica la candidata a versión 1 de tokenizers, mucho más rápida y con los mismos identificadores

    Hugging Face publicó el 21 de septiembre las mediciones de la versión 1 de tokenizers, la biblioteca abierta que convierte el texto en identificadores antes de que el modelo lo procese. Según sus pruebas, la v1 es más rápida que la 0.23 «a menudo por decenas de veces» y escala al 76 % de lo lineal repartida entre ocho procesos. La mejora viene de sustituir el motor de expresiones regulares por un separador escrito a mano, añadir una caché de palabras repetidas y usar un bucle de fusión que no toca el asignador de memoria.

    Preview o betaPreview

  • Local y open source

    Cohere publica North Small Translate, un modelo de traducción con pesos abiertos para uso no comercial

    Cohere presentó el 10 de septiembre North Small Translate, su primer modelo de traducción de la familia North, con soporte para más de 50 idiomas. Es un modelo de mezcla de expertos de 218.000 millones de parámetros, de los que activa 25.000 millones. Sus pesos se pueden descargar en Hugging Face con licencia CC BY-NC 4.0, para investigación y uso no comercial; el uso comercial exige licencia, y las empresas también pueden usarlo a través de Language Weaver, de RWS.

    LanzamientoDisponible