Hugging Face Blog ha publicado un artículo sobre el ajuste de un modelo con 350 millones de parámetros para generar respuestas estructuradas de mayor calidad. El título también menciona 100 pasos de GRPO.

El paquete disponible contiene únicamente metadatos y una breve descripción de la misión de Hugging Face de desarrollar y democratizar la inteligencia artificial a través del código abierto y la ciencia abierta. Faltan datos sobre los resultados, el conjunto de datos utilizado y la comparación con el modelo base.