ComPO: aligning large language models by comparing outputs instead of relying on likelihoods | arXiv News