Fine-tuning
Usa fine-tuning para enseñar estilo, estructura y criterio de respuesta a partir de ejemplos.
Fine-tuning no es lo mismo que añadir documentos.
El conocimiento enseña hechos. El fine-tuning enseña comportamiento.
Usa fine-tuning cuando
- los hechos son mayormente correctos pero las respuestas no parecen de tu equipo
- las respuestas necesitan un formato estable
- el asistente debe imitar ejemplos de respuesta fuertes
- preguntas similares reciben tratamiento inconsistente
- los usuarios necesitan criterio, no solo búsqueda
Qué pertenece a los ejemplos de entrenamiento
Cada ejemplo debe mostrar una entrada real y la respuesta que querrías que produjera el asistente.
Buenos ejemplos incluyen:
- preguntas de soporte con respuestas finales aprobadas
- preguntas internas con respuestas claras basadas en políticas
- ejemplos antes/después de respuestas mejoradas
- casos límite que muestran cuándo rechazar o escalar
Malos ejemplos incluyen:
- documentos fuente copiados
- preguntas vagas con respuestas genéricas
- ejemplos que contradicen la política actual
- respuestas que no querrías enviar a un usuario
Fine-tuning no arregla malas fuentes
Si la respuesta tiene hechos incorrectos, corrige primero la base de conocimiento.
Si la respuesta tiene hechos correctos pero mala estructura, tono o criterio, mejora ejemplos y haz fine-tuning.
Ejecutar un fine-tune
Ejecuta fine-tuning cuando el conjunto de datos tenga suficientes buenos ejemplos para enseñar un patrón. Al terminar, compara respuestas antiguas y nuevas en el área de pruebas.
Los ejemplos entrenan comportamiento, formato y criterio. No deben ser volcados de fuentes sin revisar.
