数据世界
产业资讯 宏观经济 企业动态 人物动态 科技数码 数据洞察 AI前沿 行业峰会 热点资讯

苹果推出RLCF技术:以大模型为导师,强化小模型复杂指令执行能力

2025-08-26来源:ITBEAR编辑:瑞雪

苹果公司在强化学习领域迈出了创新步伐,其研究人员最近提出了一种名为“基于清单反馈的强化学习”(RLCF)的新方法。这一方法旨在优化大语言模型(LLMs)处理复杂指令的能力,摒弃了传统的人类点赞或点踩评分模式。

RLCF,全称Reinforcement Learning from Checklist Feedback,它的核心在于为每个用户指令生成详细的检查清单,并根据0到100分的评分系统对每一项进行评判。这一改变,使得模型在优化过程中能够接收到更加具体和针对性的反馈,而非仅仅依赖于笼统的人类喜好。

为了验证RLCF方法的有效性,研究团队在强指令跟随模型Qwen2.5-7B-Instruct上进行了测试,测试涵盖了五个常用的评测基准。结果显示,RLCF在所有测试中均取得了显著提升:FollowBench的硬性满意率提高了4个百分点,InFoBench提升了6点,Arena-Hard的胜率增加了3点,部分任务的最大提升甚至达到了8.2%。这些数据无疑证明了清单反馈在应对复杂、多步骤任务时的强大效果。

在清单的生成方面,苹果的研究团队也展现出了独到的见解。他们利用规模更大的Qwen2.5-72B-Instruct模型,结合现有的研究方法,为13万条指令创建了名为“WildChecklists”的数据集。这些数据集中的清单条目都是明确的二元判断项,例如“是否准确翻译为目标语言”。随后,大模型会对候选回答进行逐项评分,并将这些评分综合加权,作为小模型训练的奖励信号。

然而,苹果研究者也坦诚地指出了RLCF方法的局限性。首先,它依赖于性能更强的模型作为评判者,这在资源受限的环境下可能难以实现。其次,RLCF专注于提升复杂指令的执行能力,并未专门设计用于安全性对齐,因此不能替代安全性评估与优化。对于其他类型的任务,该方法的适用性仍需进一步的研究和验证。

荣耀500 Pro规格揭晓:骁龙8 Elite加持 2亿主摄配8000mAh大电池
IT之家 11 月 14 日消息,博主 @数码闲聊站 今日曝光了荣耀 500 Pro 手机的核心规格,这款新机将于近期上市。 IT之家整理如下:6.55 英寸 2736*1264p 120Hz 中屏 骁龙…

2025-11-15

中芯国际三季度业绩亮眼:月产能破百万,全年收入或创新高
赵海军指出,中国区收入的显著增长主要受益于国内产业链自主化进程加快,为应对客户紧急需求,公司及时优化了产能分配策略。赵海军补充表示,在当前国内企业加速替代海外供应链的背景下,公司长期合作的客户成功把握了市场机…

2025-11-14

欧加9K级大电池定版试产,一加骁龙8系直屏新机测试,中端机竞争升级
IT之家 11 月 14 日消息,博主 @数码闲聊站 今天在微博透露,欧加的 9K 级别大电池现已定版试产。 博主表示,这块电池采用单块4.51V 单电芯设计,额定容量 32.59Wh,额定电池 8760m…

2025-11-14

第45周国内手机市场格局:苹果领跑,小米vivo紧随其后竞争激烈
据CNMO了解,截至11月2日,该系列在国内的激活数量已突破825万台,其中iPhone 17 Pro Max约395.7万台、iPhone17 Pro约246.2万台、标准版iPhone 17约172.8…

2025-11-14

W45周手机销量榜:苹果蝉联五周冠军,小米稳居国产首位,vivo紧随其后
每到周五可能大家都在等行业人士给出的最新一周国内智能手机领域排行榜,因为从周榜就可以分析出各品牌目前在国内生存状况。数据显示苹果还是国内排名第一的品牌,不过市场份额又滑落了一个百分点,这已经是苹果连续五周国内…

2025-11-14

华为Mate 80系列新料:20GB国产内存搭配麒麟9030 配置亮点多
根据近期华为新机规划以及各方爆料,这款机型预计为华为 Mate 80 系列,有爆料称该系列新品将在 11 月 25 日发布。其中,ProMax 并非简单的名称更换,而是定位与 Pro 版差距更大的新增机型…

2025-11-14

Q3国内消费级XR设备销量攀升 雷鸟领衔AR市场技术融合前景广阔
报告显示,国内消费级AR和VR眼镜市场销量达16.9万台,环比增长17%,同比增长57%。消费级VR设备销量为4.0万台,环比增长8%,Meta低价策略维持了VR市场的小幅增长。VR设备采用的Fast LC…

2025-11-13

宇树科技G1-D轮式人形机器人上线,携全栈方案助力开发者高效研发
该方案的核心是基于一款名为 G1-D的轮式人形机器人,并集成了系统化的数据采集工具与全面的模型训练及推理工具,旨在为开发者提供一站式的机器人研发平台。 在控制响应方面,G1-D的升降精度为 ±0.5m,末…

2025-11-13

OpenAI推出GPT-5.1系列:对话更有趣,推理更持久,个性化风格增至八种
11 月 13 日消息,OpenAI 今天(11 月 13 日)发布公告,宣布推出 GPT-5.1 系列旗舰模型,官方声称此次升级旨在“让ChatGPT 更智能,对话体验更有趣”。 IT之家援引博文介绍,此…

2025-11-13

GPT-5.1正式登场:从参数跑分到懂你交互,AI助手开启新未来
GPT-5.1 在风格化的另一大改进是,自定义指令现在能更可靠地,在多轮对话中坚持住,ChatGPT可以更稳定地,按照我们定义的个性来完成各项任务。 OpenAI 这次提供了后悔药,付费用户在 3 个月内…

2025-11-13