
IA
DPO sobre HH-RLHF: auditar el sesgo antes de entrenar
Un flujo completo de aprendizaje por preferencias que primero mide si el dataset de Anthropic esconde atajos de longitud y léxico, y recién después ajusta un Qwen2.5 de 0,5B con TRL y LoRA.
MarkTechPost