Precios

OpenRouter abre una API por lotes que cuesta la mitad y funciona ya en más de setenta modelos

OpenRouter presentó el 22 de septiembre una API por lotes para trabajos que no necesitan respuesta inmediata. Al enviar un lote, el proveedor elige en qué momento de una ventana de 24 horas lo procesa y, a cambio, suele cobrar el 50 % de su precio normal por token, a veces menos. Funciona ya en más de setenta modelos. Según la compañía, en dos semanas de pruebas se completaron más de 230.000 lotes, con una mediana de siete minutos y el 90 % terminado en menos de una hora.

LanzamientoDisponibleSin confirmar si afecta al plan gratuito

Qué significa para ti

Sirve para el trabajo que puede esperar: etiquetar un corpus, rellenar embeddings, puntuar un conjunto de evaluación o pasar el mismo prompt por miles de filas. El descuento se aplica al precio por token y varía según el modelo, así que conviene mirarlo antes de contar con la mitad exacta. Quedan fuera el audio, el vídeo y su propio complemento de búsqueda web, que se cobra a tarifa normal; las imágenes y los ficheros deben ser URL públicas, y lo enviado se guarda 30 días o hasta que se borre el lote.

Fuentes

Todo lo anterior sale de estas páginas. Si alguna contradice lo que publicamos, gana la fuente y lo corregimos.

Seguir leyendo

  • Modelos de lenguaje

    OpenAI presenta GPT-6 Sol y Luna, con el mismo contexto que Astra y una fracción de su precio

    OpenAI presentó el 22 de septiembre GPT-6 Sol y GPT-6 Luna, dos modelos que, según la compañía, llevan la inteligencia de frontera al trabajo diario con distintos equilibrios entre capacidad y coste. Su documentación describe Sol para programación compleja y flujos con agentes, y Luna como el más eficiente para tareas concretas de gran volumen. Los dos comparten una ventana de contexto de 1,05 millones de tokens y 128.000 de salida máxima, admiten texto e imagen, y se usan desde la API de Respuestas y los SDK oficiales.

    LanzamientoDisponible

  • Local y open source

    Transformers ejecuta ya las cuantizaciones GGUF de llama.cpp, con la ruta rápida limitada a Apple Silicon

    Hugging Face publicó el 22 de septiembre el soporte para ejecutar modelos en formato GGUF dentro de transformers, el formato que desarrolló el equipo de llama.cpp y que se usa para inferencia local. Basta elegir un GGUF del Hub, cargarlo con from_pretrained indicando el fichero y generar en la propia máquina, sin configuración adicional. El mismo fichero sirve con transformers serve, que expone una API compatible con la de OpenAI. Por ahora hay que instalar transformers desde su rama principal, no desde una versión publicada.

    ActualizaciónPreview

  • Local y open source

    Hugging Face publica la candidata a versión 1 de tokenizers, mucho más rápida y con los mismos identificadores

    Hugging Face publicó el 21 de septiembre las mediciones de la versión 1 de tokenizers, la biblioteca abierta que convierte el texto en identificadores antes de que el modelo lo procese. Según sus pruebas, la v1 es más rápida que la 0.23 «a menudo por decenas de veces» y escala al 76 % de lo lineal repartida entre ocho procesos. La mejora viene de sustituir el motor de expresiones regulares por un separador escrito a mano, añadir una caché de palabras repetidas y usar un bucle de fusión que no toca el asignador de memoria.

    Preview o betaPreview