徽标
我的项目 WeHub 热榜 数据中心
注册 登录
徽标
项目文件夹 工单
mirrors / liguodongiot--llm-action
项目文件夹 工单

项目文件夹

liguodongiot--llm-action
liguodongiot--llm-action mirrors
我的项目 创建
文件
main
/llm-alignment
T
文件历史
wehub-resource-sync 605accf02b chore: import upstream snapshot with attribution
2026-07-13 13:23:29 +08:00
..
DPO.md
chore: import upstream snapshot with attribution
2026-07-13 13:23:29 +08:00
README.md
chore: import upstream snapshot with attribution
2026-07-13 13:23:29 +08:00
RLHF.md
chore: import upstream snapshot with attribution
2026-07-13 13:23:29 +08:00
基本概念.md
chore: import upstream snapshot with attribution
2026-07-13 13:23:29 +08:00

README.md

  • 关于Instruct GPT复现的一些细节与想法
  • 人人都能看懂的PPO原理与源码解读
  • MOSS-RLHF
  • 模型调优(RLHF/DPO/ORPO)- 终极指南
  • DPO: Direct Preference Optimization 论文解读及代码实践
  • 强化学习入门:基本思想和经典算法
  • 动手学强化学习

ORPO:

  • ORPO: Monolithic Preference Optimization without Reference Model
  • https://github.com/xfactlab/orpo
  • https://arxiv.org/pdf/2307.12966.pdf
在新工单中引用 查看 Git Blame 复制永久链接
由 wehub 强力驱动
简体中文
English 简体中文
许可证 API