Local y open source
Ai2 abre Olmo-core 3, la infraestructura con la que entrena sus propios modelos de mezcla de expertos
Ai2 publicó el 1 de octubre Olmo-core 3, una revisión de su marco para desarrollar modelos de lenguaje con un sistema de entrenamiento de mezcla de expertos rediseñado y abierto. Está pensado para escalar ese entrenamiento hasta el rango del billón de parámetros sin perder eficiencia, y es una de las piezas con las que construirán la próxima generación de Olmo. Dice que es completamente abierto: investigadores y desarrolladores pueden usarlo para entrenar sus propios modelos, adaptarlo a otro hardware y experimentar con el enrutado y el paralelismo.
LanzamientoDisponibleSin confirmar si afecta al plan gratuito
Qué significa para ti
El problema que dice atacar es de acceso: entrenar modelos grandes cuesta tanto cómputo que, sostiene Ai2, deja el desarrollo avanzado fuera del alcance de muchos académicos y laboratorios pequeños. Sus cifras, medidas por ellos: al pasar de 8 a 128 expertos manteniendo cuatro por token, la capacidad total subió de 4.600 a 47.000 millones de parámetros y el rendimiento cayó menos de un 5 %; con ocho B300, un modelo de 47.000 millones procesó 52.000 tokens por segundo y GPU frente a 19.400 antes. Y la letra pequeña: las pruebas del billón usaron enrutado aleatorio, no un modelo entrenado.
Fuentes
Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.
Seguir leyendo
- Local y open source
Ollama estrena modelos de decisión que responden en la propia máquina, y uno de los tres es de código abierto
Ollama añadió el 29 de septiembre soporte para modelos de decisión, basados en la API Jev de TypeSafe. Está disponible desde la versión 0.35 mediante un endpoint nuevo, /v1/systemone: se le envía un texto como estado junto a un conjunto de preguntas con nombre y un modelo que corre en la propia máquina las responde todas en una sola petición. Lo presenta como decisiones rápidas y con tipos, sin coste adicional y con menos latencia al ejecutarlo en local, con tres modelos disponibles el mismo día.
ActualizaciónDisponible
- Local y open source
Transformers ejecuta ya las cuantizaciones GGUF de llama.cpp, con la ruta rápida limitada a Apple Silicon
Hugging Face publicó el 22 de septiembre el soporte para ejecutar modelos en formato GGUF dentro de transformers, el formato que desarrolló el equipo de llama.cpp y que se usa para inferencia local. Basta elegir un GGUF del Hub, cargarlo con from_pretrained indicando el fichero y generar en la propia máquina, sin configuración adicional. El mismo fichero sirve con transformers serve, que expone una API compatible con la de OpenAI. Por ahora hay que instalar transformers desde su rama principal, no desde una versión publicada.
ActualizaciónPreview
- Local y open source
Hugging Face publica la candidata a versión 1 de tokenizers, mucho más rápida y con los mismos identificadores
Hugging Face publicó el 21 de septiembre las mediciones de la versión 1 de tokenizers, la biblioteca abierta que convierte el texto en identificadores antes de que el modelo lo procese. Según sus pruebas, la v1 es más rápida que la 0.23 «a menudo por decenas de veces» y escala al 76 % de lo lineal repartida entre ocho procesos. La mejora viene de sustituir el motor de expresiones regulares por un separador escrito a mano, añadir una caché de palabras repetidas y usar un bucle de fusión que no toca el asignador de memoria.
Preview o betaPreview