
欢迎阅读AIGC动态
原文标题:大型RLHF模型无需完全依赖人类,谷歌:AI反馈效果同样出色
关键词:解读, 模型, 人类, 反馈, 机器人
文章来源:量子位
内容字数:3757字
内容摘要:最近,就训练大型模型而言,基于人类反馈的强化学习(RLHF)是一个不可避免的话题。无论是ChatGPT还是开源的LLaMA,都少不了它。但其中的“H”确实是一个瓶颈,因为收集高质量的人类反馈实在太困难。那么,是否可以交由AI来完成呢?有些人尝试过,但能否替代RLHF一直没有定论,直到Google进行了相关研究。在一篇新发布的arXiv论文中,…
原文链接:请阅读原文:大型RLHF模型无需完全依赖人类,谷歌:AI反馈效果同样出色
联系作者
文章来源:量子位
作者微信:QbitAI
作者简介:致力于追踪人工智能新趋势,关注科技行业的最新突破
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关AI热点
暂无评论...