
La guía para ajustar Qwen3-0.6B para llamadas a herramientas propone un flujo completo de entrenamiento supervisado con el conjunto de datos XYZ-Aquila-SFT. El proceso cubre desde la inspección de ejemplos y esquemas de herramientas hasta la conversión de conversaciones y la evaluación de las predicciones.
El procedimiento combina Hugging Face Transformers, PyTorch y PEFT. El ajuste se realiza mediante LoRA sobre Qwen3-0.6B, con una configuración pensada para experimentar con trayectorias de uso de herramientas que incluyen mensajes del sistema, llamadas estructuradas, observaciones y bloques de razonamiento integrados en los datos.
Un pipeline de ajuste supervisado que transforma XYZ-Aquila-SFT a un formato compatible con Qwen3, aplica una máscara de pérdida exclusiva para las respuestas del asistente y prepara un modelo capaz de aprender patrones de llamadas a herramientas.
Del conjunto de datos a las trayectorias estructuradas
El tutorial comienza cargando XYZ-Aquila-SFT en streaming desde Hugging Face y tomando una muestra limitada para analizarla. La configuración mostrada extrae hasta 400 ejemplos y revisa campos como la pregunta, la respuesta, el número declarado de llamadas y la trayectoria completa de mensajes.
Después, cada ejemplo se convierte en una estructura con la que se pueden estudiar por separado las llamadas, las observaciones y los mensajes de razonamiento. El analizador busca las llamadas insertadas en el contenido del asistente y utiliza un lector de objetos JSON con soporte para estructuras anidadas, algo relevante cuando los argumentos de una herramienta contienen otros objetos.
Qué estadísticas se recopilan
- Número de llamadas por trayectoria y distribución de sus nombres.
- Cantidad de mensajes y caracteres de cada conversación.
- Frecuencia de las claves empleadas en los argumentos de las herramientas.
- Número de observaciones y bloques de razonamiento detectados.
- Coincidencia entre las llamadas extraídas y el contador declarado en cada registro.
Estas métricas permiten localizar conversaciones especialmente largas, comprobar la consistencia del parser y detectar qué herramientas o argumentos aparecen con mayor frecuencia. El material también contempla representar las distribuciones mediante gráficos para facilitar el análisis del corpus.
Conversión al formato de Qwen3
Una parte central del flujo consiste en transformar los esquemas de herramientas entre dos representaciones: la que aparece integrada en los mensajes del sistema y otra estructurada que pueda reutilizarse durante la preparación del entrenamiento. A continuación, las conversaciones se renderizan con ChatML compatible con Qwen.
La función de pérdida se enmascara para que el modelo solo aprenda a partir de las respuestas del asistente. De este modo, los mensajes del usuario, las instrucciones del sistema y las observaciones de las herramientas sirven como contexto, pero no contribuyen directamente al objetivo supervisado. La longitud máxima configurada es de 2.048 tokens y la política indicada para los ejemplos más largos es truncarlos.
Ajuste con LoRA y evaluación
La configuración utiliza Qwen/Qwen3-0.6B como modelo base y PEFT para aplicar LoRA. El ejemplo fija un rango LoRA de 16, una tasa de aprendizaje de 0,0001, acumulación de gradientes en ocho pasos y un máximo de 30 pasos de entrenamiento. También establece una muestra de evaluación de 40 elementos y 24 sondas para probar las llamadas.
El entorno comprueba si hay una GPU CUDA disponible y si admite BF16 antes de iniciar el proceso. Al finalizar, el flujo está preparado para comparar la predicción de llamadas antes y después del ajuste, además de exportar el conjunto de datos transformado y las estadísticas del corpus para futuras pruebas.
Qué aporta este enfoque
La principal utilidad de la propuesta está en ofrecer un recorrido reproducible para trabajar con datos de uso de herramientas sin reducir las conversaciones a simples pares de pregunta y respuesta. La conservación de esquemas, observaciones y patrones de razonamiento ayuda a mantener el contexto operativo de cada trayectoria durante la preparación.
Sin embargo, el material no incluye cifras de precisión, ejemplos comparativos ni resultados independientes que permitan medir cuánto mejora Qwen3-0.6B tras el ajuste. Por tanto, la configuración funciona como base experimental y no como una validación concluyente del rendimiento del modelo en agentes o flujos de automatización.
Conclusión
Esta guía reúne las piezas necesarias para adaptar Qwen3-0.6B a tareas de predicción de llamadas a herramientas mediante XYZ-Aquila-SFT y LoRA. Su valor está en detallar la limpieza, el análisis y el formateo de las trayectorias antes del entrenamiento, una fase que condiciona el comportamiento posterior del modelo.
El siguiente paso será comprobar con evaluaciones más amplias si el modelo ajustado generaliza a herramientas, argumentos y conversaciones que no aparezcan en la muestra de entrenamiento.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.


