Local y open source

Hugging Face publica la candidata a versión 1 de tokenizers, mucho más rápida y con los mismos identificadores

Hugging Face publicó el 21 de septiembre las mediciones de la versión 1 de tokenizers, la biblioteca abierta que convierte el texto en identificadores antes de que el modelo lo procese. Según sus pruebas, la v1 es más rápida que la 0.23 «a menudo por decenas de veces» y escala al 76 % de lo lineal repartida entre ocho procesos. La mejora viene de sustituir el motor de expresiones regulares por un separador escrito a mano, añadir una caché de palabras repetidas y usar un bucle de fusión que no toca el asignador de memoria.

Preview o betaEn preview o betaSin confirmar si afecta al plan gratuitoVerificada

Qué significa para ti

Para quien ya la usa, lo importante es que la salida no cambia: la v1 produce exactamente los mismos identificadores que la biblioteca publicada y se llama igual, así que actualizar altera los tiempos y no los resultados. Hugging Face sitúa el problema en que tokenizar puede dejar la GPU esperando a la CPU cuando se entrena con conjuntos enormes o se atienden muchas peticiones a la vez. De momento es una candidata a versión en crates.io; falta cubrir más familias de modelos antes de la 1.0.0.

Fuentes

Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.

Seguir leyendo

  • Local y open source

    Migrating from closed to open source models, Together

    together.ai publicó esto el 2026-09-16, según la fecha que declara su propia página. Sobre la disponibilidad, el anuncio dice: «⚡ On-demand B200s now available on Together GPU Clusters →.».

    LanzamientoDisponible

  • Local y open sourceAfecta al plan gratuito

    Heart of the Matter: How a Major Children’s Hospital Uses Open Source NVIDIA AI for Cardiac Care

    blogs.nvidia.com publicó esto el 2026-09-15, según la fecha que declara su propia página. Sobre la disponibilidad, el anuncio dice: «Perplexity Portable Computer Is Now Available on Windows, Powered by NVIDIA RTX As local models become more capable, AI agents can handle more work directly on a PC while keeping sensitive information on the device.».

    LanzamientoDisponible

  • Local y open source

    Introducing North Small Translate: A leading sovereign open-weight machine translation model

    cohere.com publicó esto el 2026-09-10, según la fecha que declara su propia página. Sobre la disponibilidad, el anuncio dice: «Now available for research and non-commercial use under a CC BY-NC 4.0 license, North Small Translate advances Cohere’s mission to make sovereign AI a technological reality..». Sobre el precio: «For enterprises evaluating commercial licenses of North Small Translate, benefit from a strong 80.1 score at just $0.000676 per task, using only 661 tokens on…».

    LanzamientoDisponible