AICon 上海站|90%日程已就绪,解锁Al未来! 了解详情
写点什么

小模型时代来了?微软推出其最小参数 AI 模型,性能逼近 GPT-3.5

  • 2024-04-23
    北京
  • 本文字数:964 字

    阅读完需:约 3 分钟

大小:152.66K时长:00:52
小模型时代来了?微软推出其最小参数AI模型,性能逼近GPT-3.5

当地时间 4 月 23 日,微软宣布推出其轻量级人工智能模型 Phi-3 Mini 的下一版本,这是该公司计划发布的三个小型模型中的第一个。 


Phi-3 Mini 可测量参数仅为 38 亿,并在相对于 GPT-4 等大型语言模型更小的数据集上进行训练。现已在 Azure、Hugging Face 和 Ollama 上可使用。另外,微软还计划发布 Phi-3 Small(7B 参数)和 Phi-3 Medium(14B 参数)两个版本。


微软在去年 12 月时发布了 Phi-2,其性能与 Llama 2 等更大的型号不相上下。微软表示,Phi-3 的性能比前一版本更好,其响应速度接近比它大 10 倍的模型


微软 Azure 人工智能平台公司副总裁埃里克· 博伊德(Eric Boyd)介绍说,Phi-3 Mini 的性能与 GPT-3.5 等 LLM 不相上下,"只是外形尺寸更小而已"。


与大型人工智能模型相比,小型人工智能模型通常运行成本更低,并且在手机和笔记本电脑等个人设备上表现更好。据外媒《The Information》今年早些时候报道称,微软正在组建一个专门专注于轻量级人工智能模型的团队。与 Phi 一起,该公司还构建了 Orca-Math,一个专注于解决数学问题的模型。


微软的竞争对手也在研发自己的小模型,其中大多数针对更简单的任务,例如文档摘要或编码辅助。其中最典型的就是 Google 的 Gemma 2B 和 7B,这两款模型更适合简单的聊天机器人和语言相关的工作。


此外,Anthropic 的 Claude 3 Haiku 可以阅读带有图表的密集研究论文并快速总结它们,而 Meta 最近发布的 Llama 3 8B 可以用于一些聊天机器人和编码辅助。


Boyd 表示,开发人员通过“课程”对 Phi-3 进行了训练。他们的灵感来自于孩子们如何从睡前故事、单词更简单的书籍以及谈论更大主题的句子结构中学习。


“市面上没有足够的儿童读物,因此我们列出了 3000 多个单词的清单,并要求大语言模型制作‘儿童读物’来教授 Phi,”Boyd 说。 


他补充说,Phi-3 只是建立在之前迭代所学到的知识之上。 Phi-1 专注于编程,Phi-2 开始学习推理,而 Phi-3 更擅长编程和推理。虽然 Phi-3 系列模型能够了解一些常识,但它无法在更大范围的应用场景中击败 GPT-4 或其他大语言模型。


Boyd 表示,公司经常发现像 Phi-3 这样的较小模型更适合他们的定制应用程序,因为对于许多公司来说,他们的内部数据集规模都比较小,而这些使用较少算力的小模型更具性价比。


参考链接:


https://www.theverge.com/2024/4/23/24137534/microsoft-phi-3-launch-small-ai-language-model


2024-04-23 18:205759
用户头像
李冬梅 加V:busulishang4668

发布了 1061 篇内容, 共 677.6 次阅读, 收获喜欢 1223 次。

关注

评论

发布
暂无评论
发现更多内容

除了直接看余额,谁更有钱还能怎么比(一)

石君

零知识证明 多方计算 同态加密

我是如何拿下PMP认证和系统架构设计师考试的?

Nick

RocketMQ - 什么是RocketMQ

Java收录阁

RocketMQ

游戏夜读 | 怎么让游戏跑起来?

game1night

prometheus中honor_labels配置项的源码分析

陈思敏捷

Prometheus Go 语言

new() 和 make的区别

陈思敏捷

源码 源码分析 Go 语言

你是个伪工作者么?

池建强

个人成长 伪工作者

python实现·十大排序算法之快速排序(Quick Sort)

南风以南

Python 排序算法 快速排序

Go: Trace包探秘

陈思敏捷

原理 Go 语言

圆圈正义 - 读后感

石云升

读书笔记 法律 公平 现实

《零基础学 Java》 FAQ 之 12-理解引用

臧萌

Java

2020 年 5 月 23 日 Java 集合专题

瑞克与莫迪

Java

Tekton 的工作原理

张晓辉

Kubernetes cicd 云原生

看完这篇 Session、Cookie、Token,和面试官扯皮就没问题了

苹果看辽宁体育

https

Flask-SQLAlchemy 多表对单模型

Leetao

Python flask 编程语言 flask-sqlalchemy

《零基础学 Java》 FAQ 之 11-为什么构造方法中调用重载的构造方法必须得是在第一行

臧萌

利与弊-传统框架要不要部署在Serverless架构上

刘宇

Serverless Web

我的编程之路 -5(停滞)

顿晓

网络编程 操作系统 编程之路 停滞 三年

python实现·十大排序算法之插入排序(Insertion Sort)

南风以南

Python 排序算法 插入排序

《零基础学 Java》 FAQ 之 10-Scanner里nextInt的小坑

臧萌

Java

其实你就是我羡慕的别人

小天同学

个人成长 感悟 日常思考

区块链2.0--以太坊概述

皮卡丘的猫

工作=投资=创业?

二鱼先生

个人成长 工作思路 工作方式 创业心态 创业者

云直播平台的选型与使用

音视频专家-李超

谈谈控制感(8):元控制感

史方远

职场 心理 成长

JUC整理笔记一之细说Unsafe

JFound

Java

Mysql增量更新-ON DUPLICATE KEY UPDATE

BerryMew

MySQL 增量更新 ON DUPLICATE KEY UPDATE

Go: g0, 特殊的goroutine

陈思敏捷

原理 Go 语言

Go: 应该使用指针还是结构体副本?

陈思敏捷

struct 原理 pointer Go 语言

k8s上运行我们的springboot服务之——cloud gateway

柠檬

k8s Spring Cloud

Java环境搭建

编号94530

Java java8 Java环境 环境安装 jdk安装

小模型时代来了?微软推出其最小参数AI模型,性能逼近GPT-3.5_生成式 AI_李冬梅_InfoQ精选文章