优质文档

  1. 【手撕RLHF_Weak-to-Strong】OpenAI超级对齐新思路(含代码)。openai文档:WEAK-TO-STRONG GENERALIZATION: ELICITING STRONG CAPABILITIES WITH WEAK SUPERVISION

  2. 【手撕RLHF-Aligner】7B模型外挂,暴涨GPT4安全性26.9%。论文:Aligner: Achieving Efficient Alignment through Weak-to-Strong Correction

提出背景

  1. 人类强的的超人模型(superhuman model) ,将会产生人类无法理解的创造性行为,比如产生百万行的代码(直接用汇编写电商页面) ,人类是无法去做这种scaling的监督

  2. 通过reward model的分数来对齐模型,一旦模型的行为复杂(难以解释的),reward的监督是否还可靠存疑

从而,为了解决现存对齐的2个缺陷,需要沿着无监督/弱监督方向来做

Weak-to-Strong训练流程

根据源码实现流程如下:文中给出了训练的源代码

代码里的强模型strong model选用GPT2-XL

Auxiliary Confidence Loss

解决的问题:

  1. 训练过程中,模型可以识别出标签中的错误

  2. 训练过程中,当弱监督输出错误的结果时,强模型可以纠正弱监督模型的错误

loss的推导和理解:

具体代码实现如下:

def __call__(
        self,
        logits: torch.Tensor, # strong model logits
        labels: torch.Tensor, # weak supervisor softlabels (prob)
        step_frac: float,
    ) -> torch.Tensor:
        coef = 1.0 if step_frac > self.warmup_frac else step_frac
        coef = coef * self.aux_coef
        
        preds = torch.softmax(logits, dim=-1) # strong model pred
        mean_weak = torch.mean(labels, dim=0) # 
        threshold = torch.quantile(preds[:, 0], mean_weak[1]) # t
        # indicator function hat{f}
        strong_preds = torch.cat(
            [(preds[:, 0] >= threshold)[:, None], (preds[:, 0] < threshold)[:, None]],
            dim=1,
        ) 
        
        # auxiliary
        target = labels * (1 - coef) + strong_preds.detach() * coef
        
        # # L_conf(f) : CE loss
        loss = torch.nn.functional.cross_entropy(logits, target, reduction="none")
        return loss.mean()

总结

  1. 目前主流的对齐方案是基于偏好的,如何对未来更强大的模型做scaling可靠性的对齐,weak-to-strong先行一步。

  2. 通过分析auxiliary confidence loss,里面的理论并不复杂,强模型可以fix弱监督模型里soft label里的错误

  3. 目前来看weak-to-strong并没有带来很惊艳的模型,而是提供了一种新的对齐思路,切勿神话。

结尾

亲爱的读者朋友:感谢您在繁忙中驻足阅读本期内容!您的到来是对我们最大的支持❤️

正如古语所言:"当局者迷,旁观者清"。您独到的见解与客观评价,恰似一盏明灯💡,能帮助我们照亮内容盲区,让未来的创作更加贴近您的需求。

若此文给您带来启发或收获,不妨通过以下方式为彼此搭建一座桥梁: ✨ 点击右上角【点赞】图标,让好内容被更多人看见 ✨ 滑动屏幕【收藏】本篇,便于随时查阅回味 ✨ 在评论区留下您的真知灼见,让我们共同碰撞思维的火花

我始终秉持匠心精神,以键盘为犁铧深耕知识沃土💻,用每一次敲击传递专业价值,不断优化内容呈现形式,力求为您打造沉浸式的阅读盛宴📚。

有任何疑问或建议?评论区就是我们的连心桥!您的每一条留言我都将认真研读,并在24小时内回复解答📝。

愿我们携手同行,在知识的雨林中茁壮成长🌳,共享思想绽放的甘甜果实。下期相遇时,期待看到您智慧的评论与闪亮的点赞身影✨!

万分感谢🙏🙏您的点赞👍👍、收藏⭐🌟、评论💬🗯️、关注❤️💚~


自我介绍:一线互联网大厂资深算法研发(工作6年+),4年以上招聘面试官经验(一二面面试官,面试候选人400+),深谙岗位专业知识、技能雷达图,已累计辅导15+求职者顺利入职大中型互联网公司。熟练掌握大模型、NLP、搜索、推荐、数据挖掘算法和优化,提供面试辅导、专业知识入门到进阶辅导等定制化需求等服务,助力您顺利完成学习和求职之旅(有需要者可私信联系) 

友友们,自己的知乎账号为“快乐星球”,定期更新技术文章,敬请关注!

Logo

码道开发者社区,聚焦华为云码道 CodeArts 代码智能体,沉淀 Agent、Skill、鸿蒙开发实战内容,供开发者查阅资料、交流技术、分享工程实践

更多推荐