
Crear un modelo de razonamiento pequeño con LoRA es posible sin descargar un corpus completo ni emplear una infraestructura especialmente grande. Un nuevo tutorial plantea un flujo de trabajo basado en el corpus de razonamiento de SupraLabs, disponible mediante Hugging Face, y en el modelo SmolLM2-135M-Instruct.
La propuesta cubre el proceso completo en Google Colab: acceder a los datos en streaming, estudiar su composición, descartar ejemplos poco adecuados, convertirlos a un formato de ajuste supervisado y entrenar una adaptación eficiente con la biblioteca TRL y LoRA.
El flujo combina una muestra de 8.000 registros del corpus SupraLabs, filtrado heurístico y ajuste supervisado de SmolLM2-135M-Instruct mediante LoRA, sin descargar todo el conjunto de datos.
Un corpus grande accesible mediante streaming
El tutorial utiliza el conjunto SupraLabs/reasoning-corpus-4K-5M-v1 desde el repositorio de Hugging Face. En lugar de materializar el corpus completo, el proceso abre el conjunto de entrenamiento en modo streaming, mezcla los registros con una semilla fija y extrae una muestra representativa de 8.000 filas.
Cada registro incluye campos como el repositorio de origen, la longitud en tokens, la pregunta del usuario, la traza de razonamiento y la respuesta del asistente. Esta estructura permite inspeccionar el material antes de emplearlo en el entrenamiento y reduce los requisitos de almacenamiento durante la fase inicial.
Analizar antes de entrenar
La fase exploratoria estudia la distribución de longitudes, los repositorios que más contribuyen a la muestra y la proporción entre el contenido de razonamiento y la respuesta final. También se calculan estadísticas sobre los caracteres de las trazas y se representan gráficamente las relaciones entre longitud y proporción de razonamiento.
El flujo incorpora además una clasificación aproximada de las tareas. Mediante reglas de texto, los ejemplos se agrupan en categorías como programación, matemáticas, cuestiones médicas, preguntas de opción múltiple y casos generales. No se trata de una anotación manual ni de una evaluación semántica exhaustiva, por lo que sus resultados sirven principalmente para orientar la curación.
Filtrado y preparación para el ajuste supervisado
La limpieza busca retirar ejemplos que puedan perjudicar el entrenamiento. Entre los criterios planteados están los límites de longitud y la detección de trazas con líneas repetidas, un patrón que puede señalar respuestas defectuosas o bucles de generación. El objetivo es conservar ejemplos suficientemente completos y variados dentro de un presupuesto de tokens manejable.
Después, los registros retenidos se transforman a un formato conversacional para Supervised Fine-Tuning (SFT). Las muestras mantienen una separación explícita entre la parte de razonamiento y la respuesta, mediante etiquetas estructuradas que permiten controlar cómo se presenta el resultado durante la inferencia.
LoRA para reducir el coste del entrenamiento
El modelo elegido es SmolLM2-135M-Instruct, una configuración compacta orientada a instrucciones. En vez de actualizar todos sus parámetros, el tutorial emplea LoRA, una técnica de ajuste eficiente que añade matrices entrenables de menor tamaño sobre el modelo base.
El entrenamiento se realiza con SFTTrainer, integrado en TRL. Este enfoque puede resultar útil para experimentar con modelos especializados cuando la memoria disponible es limitada, aunque el resultado dependerá de la calidad del corpus filtrado, de la configuración concreta del entrenamiento y de la evaluación posterior.
Inferencia y exportación
Una vez terminado el ajuste, el flujo prueba el modelo con inferencia estructurada para comprobar cómo genera sus respuestas. El proceso también contempla exportar el conjunto curado en formato Parquet, lo que facilita reutilizar los datos en otros experimentos o conservar una versión procesada del corpus.
El tutorial presenta así una cadena reproducible en Google Colab, desde la exploración de datos hasta la ejecución del modelo adaptado. La muestra y las reglas utilizadas permiten construir un prototipo, pero no bastan por sí solas para establecer que el modelo supere a otras alternativas en razonamiento general.
Qué aporta este enfoque
La principal utilidad de esta metodología está en hacer accesible la especialización de modelos pequeños. El streaming evita descargar todo el corpus, la exploración ayuda a detectar desequilibrios y ejemplos problemáticos, y LoRA reduce la cantidad de parámetros que deben modificarse durante el ajuste.
Quedan pendientes una validación independiente del modelo final, una descripción completa de los filtros y pruebas más amplias por tipo de tarea. Por ahora, el flujo funciona como una base práctica para estudiar cómo convertir un corpus de razonamiento de varios modelos en una adaptación compacta y especializada.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.


