
El modelo S1-mini para limpiar transcripciones ya está disponible con pesos abiertos en Hugging Face. Superwhisper lo ha diseñado para transformar la salida sin editar de un sistema de reconocimiento automático del habla (ASR) en texto escrito con puntuación, mayúsculas y un formato más natural.
S1-mini no transcribe audio ni funciona como chatbot. Se coloca después de herramientas como Whisper o Parakeet y procesa el texto obtenido para eliminar muletillas, resolver falsos comienzos y convertir números, fechas, monedas y direcciones de correo dictadas en su representación escrita.
S1-mini tiene 596 millones de parámetros, ocupa 462 MB en su versión Q4_K_M GGUF y puede ejecutarse en la CPU de un portátil. La versión 1 solo trabaja en inglés y está publicada con licencia Apache 2.0 más una cláusula de nomenclatura.
Un modelo pequeño para la última fase de la transcripción
El flujo previsto es sencillo: audio, ASR y, después, S1-mini. El modelo conserva el contenido pronunciado, pero elimina palabras de relleno, mantiene el resultado final de una autocorrección y aplica una presentación adecuada al tipo de texto. También puede devolver listas o prosa y adaptar el estilo entre casual, semiformal, semiformaI y formal.
La configuración se controla mediante una línea con tres ejes independientes: estilo, estructura y contexto. El contexto puede ser general o de correo electrónico. Superwhisper advierte de que utilizar valores no contemplados o modificar el prompt fijo puede degradar la salida. Además, la aplicación de escritorio ofrece un nivel de tono adicional, “balanced”, que no forma parte de los cuatro valores documentados para los pesos abiertos.
Qué puede hacer y qué queda fuera
S1-mini está pensado para dictado, actas de reuniones, subtítulos en directo, editores controlados por voz, introducción de datos en CRM y documentación clínica, legal o financiera. También puede ejecutarse dentro de una aplicación sin enviar las transcripciones a un servicio externo, algo relevante para organizaciones que necesitan mantener los datos en una red privada.
El modelo no añade información que el usuario no haya pronunciado, no corrige hechos, no suaviza expresiones malsonantes ni reescribe dialectos. Si la entrada solo contiene muletillas, devuelve una cadena vacía; las integraciones deben interpretar ese resultado como válido y no como un fallo.
Requisitos técnicos para integrarlo
S1-mini parte de Qwen/Qwen3-0.6B y utiliza 596 millones de parámetros únicos, con 0,44 millones de parámetros no pertenecientes a embeddings. La versión cuantizada Q4_K_M ocupa 462 MB. Para obtener resultados utilizables, Superwhisper exige desactivar el modo de razonamiento con enable_thinking=False y utilizar decodificación codiciosa con temperatura 0.
En llama.cpp, la recomendación es emplear –jinja y configurar enable_thinking=false. El modelo acepta aproximadamente 1.000 tokens de entrada y, por ahora, la primera versión está limitada al inglés.
Resultados comunicados por Superwhisper
En una prueba interna con 7.519 casos procedentes de 104 transcripciones, S1-mini alcanzó una precisión de tokens del 94,8% en la compilación Q4_K_M y una tasa de error de edición de texto del 11,6%. Identificó la línea de saludo de los correos en el 99,3% de los casos y la despedida en el 97,9%. La estructura correcta entre lista y párrafo apareció en el 97,6% de las pruebas, mientras que las direcciones de correo exactas se obtuvieron en el 92%.
Estas cifras proceden de una evaluación de la propia compañía y no equivalen a una comparación independiente. El resto de la familia S1 funciona de otra forma: S1-Voice es un servicio alojado de voz a texto y S1-Language es otro servicio en la nube destinado a limpiar, dar formato y resumir contenido. Solo S1-mini puede descargarse y ejecutarse de forma autónoma.
Conclusión
S1-mini ofrece una pieza especializada y ligera para mejorar transcripciones después del reconocimiento de voz. Su tamaño permite plantear integraciones locales en aplicaciones de escritorio y entornos privados, aunque la compatibilidad limitada al inglés y la necesidad de respetar su plantilla de conversación reducen el margen de personalización. Las cifras publicadas son prometedoras, pero todavía queda pendiente comprobar su comportamiento con pruebas externas y más idiomas.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.