写点什么

OpenAI 发布 GPT 模型规范,可作为模型微调指南

Anthony Alford I

  • 2024-06-24
    北京
  • 本文字数:1102 字

    阅读完需:约 4 分钟

OpenAI 发布 GPT 模型规范,可作为模型微调指南

OpenAI 发布 GPT 模型规范,可作为模型微调指南 OpenAI 最近发布了其模型规范,这是一份描述 GPT 模型行为规则和目标的文档。该规范可供数据标注人员和 AI 研究人员在为模型微调创建数据时使用。


该模型规范基于 OpenAI 现有内部文档,OpenAI 在他们的人类反馈强化学习(RLHF)训练中使用了这些文档。规范包含了三种类型的原则:目标、规则和默认设置。目标定义了对模型行为的广泛描述:“造福人类”。规则则更加具体,涉及到用户绝不能违反的“高风险”情况:“永远不要做 X”。最后,规范包括了默认行为,虽然它们可以被覆盖,但提供了响应的基本样式指南和处理冲突的模板。根据 OpenAI 的说法:


作为我们在集体对齐和模型安全方面工作的延续,我们打算将模型规范作为研究人员和 AI 训练者进行人类反馈强化学习的指南。我们还将探索我们的模型能够直接从模型规范中学习到怎样的程度。我们将这项工作视为正在进行的关于模型的行为、如何确定期望的模型行为以及如何让公众参与这些讨论的持续公开对话的一部分。


2022 年,OpenAI 推出 GPT-3 的微调版本 InstructGPT 。该模型使用 RLHF 对模型输出排序数据集进行微调,目的是让模型更加“对齐”用户意图,减少错误或有害的输出。从那时起,许多研究团队也对他们的 LLM 进行了类似的微调。例如,谷歌的 Gemini 模型也使用 RLHF 进行微调。Meta 的 Llama 3 也经过微调,但是采用了不同的微调方法,即直接偏好优化(DPO)。


然而,微调的关键是由人工标记器排序的具有多个输出的提示输入数据集。模型规范的部分目的是指导标注人员对输出进行排序。OpenAI 还声称正在研究直接根据模型规范自动化指令微调过程的方法。因此,模型规范的许多内容都是用户提示词以及“好”的和“坏”的响应的示例。


规范中的许多规则和默认设置旨在解决常见的 LLM 滥用问题。例如,遵循命令链规则旨在帮助防止简单的“越狱”行为,即提示模型忽略前面的指令。其他规范旨在指导模型做出响应,特别是在模型拒绝执行任务时。规范中提到:“拒绝应该用一两句话解决,不要啰嗦”。


沃顿商学院教授和 AI 研究员 Ethan Mollick 在 X 上发表了有关模型规范的帖子:


正如评论中的一些人指出的那样,Anthropic 有它自己的章程。我发现它不像声明那么有分量,也不那么清晰,因为它概述了好的内容,并告诉 AI 要做好,这让人很难理解原则之间存在怎样艰难的选择。


Anthropic 在 2022 年提出了 Constitutional AI 的概念。这个过程使用 AI 模型对输出进行排名以进行指令微调。尽管 Anthropic 的代码不是开源的,但 AI 社区 HuggingFace 基于 Anthropic 的工作发布了 Constitutional AI 的参考实现。


查看英文原文


https://www.infoq.com/news/2024/06/openai-model-spec/

2024-06-24 10:176017

评论

发布
暂无评论
发现更多内容

微信朋友圈的高性能复杂度架构

Pengfei

模块二作业 微信朋友圈高性能分析

Geek__猫猫头

2.5TinkerPop3 升级指南

Geek_古藤模根

图数据库实战

前端食堂技术周刊第 39 期:TypeScript 4.7、Layouts RFC、Lerna 复活后的大版本 v5.0.0 、TypeScript 错误翻译器

童欧巴

JavaScript typescript 前端

如何系统学习机器学习?

宇宙之一粟

机器学习 5月月更

【愚公系列】2022年05月 二十三种设计模式(十七)-中介者模式(Mediator Pattern)

愚公搬代码

5月月更

在线下划线转驼峰,驼峰转下划线工具

入门小站

工具

从发电到深空探索:微藻带来的可持续未来

脑极体

electron打包vue cli项目的配置问题

空城机

Electron 5月月更

影视解说类自媒体如何才能求同存异

石头IT视角

微信朋友圈的高性能复杂度分析

Asura

继StepN后,新的链游之光

BlockChain先知

架构实战营-模块二作业

Roy

架构实战营

6点下班不是梦,Apipost帮您轻松完成接口测试及接口文档

Xd

接口测试 apipost

[模块二作业]

wuli洋

CopyOnWriteArrayList 源码分析-基础和新增

zarmnosaj

5月月更

Vue框架学习笔记【第day三】

恒山其若陋兮

5月月更

架构实战营模块2-微信朋友圈分析

Geek_e8bfe4

聊聊 Kafka:Kafka 如何保证可靠性

老周聊架构

kafka 5月月更

网站建设导致网站失败的十个原因

源字节1号

微信小程序 前端开发 后端开发 网站开发

CPU性能测试工具

穿过生命散发芬芳

5月月更 CPU性能测试

架构实战营 模块二作业(微信朋友圈高性能复杂度分析)

Gor

如何抓住架构设计关键 - 作业

阿拉阿拉幽幽

【愚公系列】2022年05月 二十三种设计模式(十八)-备忘录模式(Memento Pattern)

愚公搬代码

5月月更

【架构训练营】模块二作业

知北游

作业

【LeetCode】判断一个数的数字计数是否等于数位的值Java题解

Albert

LeetCode 5月月更

Apipost——中文版的Postman?

Xd

API 接口测试工具

架构实战营|模块2

KDA

#架构实战营

在线HTML转ASP工具

入门小站

工具

要自信的对客户说 “NO”

源字节1号

模块二 微信朋友圈高性能架构分析

挖了蘑菇哩斯

作业 架构实战营

OpenAI 发布 GPT 模型规范,可作为模型微调指南_AI&大模型_InfoQ精选文章