谷歌:AI自主控制大模型RLHF表现一致

谷歌:AI自主控制大模型RLHF表现一致

欢迎阅读AIGC动态

原文标题:大型RLHF模型无需完全依赖人类,谷歌:AI反馈效果同样出色

关键词:解读, 模型, 人类, 反馈, 机器人

文章来源:量子位

内容字数:3757字

内容摘要:最近,就训练大型模型而言,基于人类反馈的强化学习(RLHF)是一个不可避免的话题。无论是ChatGPT还是开源的LLaMA,都少不了它。但其中的“H”确实是一个瓶颈,因为收集高质量的人类反馈实在太困难。那么,是否可以交由AI来完成呢?有些人尝试过,但能否替代RLHF一直没有定论,直到Google进行了相关研究。在一篇新发布的arXiv论文中,…

原文链接:请阅读原文:大型RLHF模型无需完全依赖人类,谷歌:AI反馈效果同样出色

联系作者

文章来源:量子位

作者微信:QbitAI

作者简介:致力于追踪人工智能新趋势,关注科技行业的最新突破

© 版权声明

相关AI热点

暂无评论

none
暂无评论...