指尖魔法屋
  • 文章
  • 分类
  • 标签
  • 时间轴
  • 关于
  • 联系
  • 🔍

PPO

奖励模型 RewardModel PPO
把评分换到优化时踩过的坑
在实际项目中,我对 reward model 有这几个具体需求: 1. **能打分**:给定 (prompt, response) 对,输出一…
醉月思 醉月思
📁 技术实践
📅 2024-04-14
强化学习 Q-Learning PPO PyTorch 算法实践
把Q-Learning换到PPO时踩过的坑
Agent在环境里试错,跟人在公司里摸鱼本质上是一回事——都在寻找最优策略,只不过一个靠探索利用,一个靠踩红线与打擦边球。
醉月思 醉月思
📁 学习笔记
📅 2021-02-15
Copyright © 2017-2026 指尖魔法屋. All rights reserved POWERED BY thinkBlog · v6.1.0 关于 · 联系 · 隐私政策 · Cookie 政策 本站已顽强运行:加载中...
粤ICP备17055617号