指尖魔法屋
  • 文章
  • 分类
  • 标签
  • 时间轴
  • 关于
  • 联系
  • 🔍

DPO

DPO 直接偏好优化 对齐
从RLHF走到DPO:AI直接偏好优化笔记
最开始尝试了传统的 RLHF(强化学习人类反馈),但过程太痛苦了——需要训练三个模型,显存要80G,训练时间一…
醉月思 醉月思
📁 技术实践
📅 2024-09-25
Copyright © 2017-2026 指尖魔法屋. All rights reserved POWERED BY thinkBlog · v6.1.0 关于 · 联系 · 隐私政策 · Cookie 政策 本站已顽强运行:加载中...
粤ICP备17055617号