2天时间,聊今年最热的 Agent、上下文工程、AI 产品创新等话题。2025 年最后一场~ 了解详情
写点什么

面壁小钢炮 3.0 重磅发布!“无限”长文本,性能超 Kimi

  • 2024-09-11
    北京
  • 本文字数:1677 字

    阅读完需:约 6 分钟

大小:830.82K时长:04:43
面壁小钢炮 3.0 重磅发布!“无限”长文本,性能超 Kimi

近日,面壁智能宣布,旗舰端侧模型面壁「小刚炮」系列进化为全新 MiniCPM 3.0 基座模型,再次以小博大,以 4B 参数,带来超越 GPT-3.5 的性能。


据介绍,MiniCPM 3.0 量化后仅 2GB 内存,端侧友好,主要特点包括:


  • 无限长文本,榜单性能超越 Kimi,超长文本也不崩;

  • 性能比肩 GPT-4o 的端侧最强 Function Calling;

  • 超强 RAG 外挂三件套,中文检索第一、生成超 Llama3-8B。


MiniCPM 3.0 开源地址:


GitHub:

🔗 https://github.com/OpenBMB/MiniCPM

HuggingFace:

🔗 https://huggingface.co/openbmb/MiniCPM3-4B


“提前近 4 个月,我们实现了初代面壁小钢炮发布时立下的 Flag:今年内让 GPT-3.5 水平的模型在端侧跑起来!”面壁智能团队表示。


据悉,MiniCPM 3.0 再次挖掘端侧模型的极致性能,仅 4B 参数,在包括自然语言理解、知识、代码、数学等多项能力上对 GPT-3.5 实现赶超,在 Qwen2-7B、 Phi-3.5、GLM4-9B、LLaMa3-8B 等一众中外知名模型脱颖而出。



历经数次调整,面壁团队构建了全新技术架构。围绕 Scaling Law 的核心,面壁将提升知识密度视为高效大模型的第一性原理(知识密度 = 模型能力 / 参与计算的模型参数),并且提出了大模型时代的“摩尔定律”:模型知识密度不断提升,平均每 8 个月提升一倍,内部称为“面壁定律”。


新一代小钢炮集长文本、Function Call 与 RAG 等大模型重要能力于一身,在这些呼声极高的模型功能上,MiniCPM 3.0 集结各家所长。

面壁“无限”长文本,性能超 Kimi


上下文长度是衡量大模型基础能力的一项重要指标,更长的上下文长度意味大模型拥有更大的“内存”和更长的“记忆”,不仅能提高大模型处理数据的能力上限,还能拓宽大模型应用的广度和深度。


面壁提出 LLMxMapReduce 长本文分帧处理技术 ,一举实现“无限”长文本。除了超越 GPT-4、KimiChat 等标杆模型的优异表现( InfiniteBench 榜单成绩),面壁还表示,文本越长,4B 小钢炮凭借愈加稳定的表现,可以展现出越强的性能优势。



InfiniteBench 大模型长文本能力的权威评测集


检索、数学、代码、问答和摘要等多维度能力评估


① MiniCPM 3.0 表现超越 GPT-4、KimiChat、Qwen2-70B;

② 千亿模型 Qwen2-70B、Llama3-70b 结合 LLMxMapReduce 也取得更佳表现。



InfiniteBench Zh.QA 评测结果显示,4B 参数的面壁小钢炮整体性能优于 Kimi,在更长的文本上表现出相较更强的稳定性。



LLMxMapReduce 技术框架图


GPT-4o 级 Function calling ,终端 Agent 应用蓄势待发


智能体应用是端侧 AI 必争之地,其中一项至关重要的技术是 Function Calling(函数调用),它能够将用户模糊化的输入语义转换为机器可以精确理解执行的结构化指令,并让大模型连接外部工具和系统,例如通过语音在手机上调用日历、天气、邮件、浏览器等 APP 或相册、文件等本地数据库,从而打开终端设备 Agent 应用的无限可能,也让人机交互更加自然和方便。


据介绍,MiniCPM 3.0 拥有端侧最强 Function calling 性能 ,在权威评测榜单 Berkeley Function-Calling Leaderboard 上,其性能接近 GPT-4o,并超越 Llama 3.1-8B、Qwen-2-7B、GLM-4-9B 等众多模型。



RAG 外挂三件套


端侧模型也能“开外挂”,RAG(检索增强生成技术)让模型引用外部知识库,检索到最新、最可靠的专业知识,确保生成内容更加可信,大大减少大模型的幻觉问题。大模型 +RAG 在行业中极其实用,尤其是对法律、医疗等依赖专业知识库、对大模型幻觉容忍度极低的垂直行业。


这次,面壁一口气带来超强 RAG 外挂三件套:MiniCPM-Embedding(检索模型)、MiniCPM-Reranker(重排序模型)和面向 RAG 场景的 LoRA 插件(生成模型),款款优秀:


  • MiniCPM-Embedding(检索模型)中英跨语言检索取得 SOTA 性能,在评估模型文本嵌入能力的权威评测集 MTEB 的检索榜单上中文第一、英文第十三 ;

  • MiniCPM-Reranker(重排序模型)在中文、英文、中英跨语言测试上取得 SOTA 性能 ;

  • 经过针对 RAG 场景的 LoRA 训练后,MiniCPM 3.0-RAG-LoRA 在开放域问答(NQ、TQA、MARCO)、多跳问答(HotpotQA)、对话(WoW)、事实核查(FEVER)和信息填充(T-REx)等多项任务上的性能表现,超越 Llama3-8B 和 Baichuan2-13B 等业内优秀模型。


2024-09-11 16:587735

评论

发布
暂无评论
发现更多内容

浅谈B端产品的表单元素设计

LigaAI

产品经理 UI 产品设计与思考

网络抓包实战03——TCP/IP协议栈:数据包如何穿越各层协议

青春不可负,生活不可欺

【MindSpore有奖活动】资讯内容宝藏多,编译安装试一波!

Geek_6cdeb6

网络抓包实战05——深入浅出连接关闭

青春不可负,生活不可欺

Redis入门五:主从复制

打工人!

redis 主从复制 6月日更

网络攻防学习笔记 Day53

穿过生命散发芬芳

网络攻防 6月日更

从渗透测试小白到网络安全大佬的成长之路

学神来啦

Linux 运维 网络安全 渗透测试

区块链如何赋能智慧城市

CECBC

网络抓包实战04——深入浅出连接建立

青春不可负,生活不可欺

信息安全与网络安全的关系

网络安全学海

程序员 网络安全 安全 信息安全 渗透测试

[译] R8 优化:方法的 Outlining 优化

Antway

6月日更

算法有救了!GitHub上神仙项目手把手带你刷算法,Star数已破110k

Java架构师迁哥

英特尔宋继强:异构计算的关键一环,先进封装已经走向前台

E科讯

产业互联网时代的数字化转型与创新

CECBC

一文带你了解什么是HTTP协议

网络安全学海

网络安全 安全 信息安全 HTTP 渗透测试

Jenkins 如何与 Kubernetes 集群的 Tekton Pipeline 交互?

张晓辉

Kubernetes 云原生 jenkins Tekton CI/CD

“半监督”、“自监督”怎么用?| 算法深度剖析与实战分享

网易易盾技术团队

AI 算法 算法实践 实践案例 深度半监督

鉴释×CSDN丨国内外操作系统生态差异在哪?

鉴释

操作系统

Java内存模型

wzh

Java JVM happens-before 并发 Java内存模型

Java线程状态与状态间的切换

wzh

Java 线程 JVM 操作系统 并发

定点数与浮点数表示

若尘

浮点数 计算机组成原理 6月日更

知乎上线1小时,5w浏览量被下架的JVM全解笔记,内容太强大

Java架构师迁哥

Java的函数式接口

中原银行

Java 函数式接口 中原银行

虚拟货币监管再加码:央行约谈部分金融机构 要求切断支付链路

CECBC

指挥中心情指勤一体化解决方案,河北公安情指勤一体化建设

网络抓包实战06——灵异事件的始作俑者:Reset数据包

青春不可负,生活不可欺

ES6 迭代器简述

编程三昧

JavaScript 大前端 ES6 迭代器

5分钟速读之Rust权威指南(二十八)RefCell<T>

wzx

rust

dubbogo 社区负责人于雨说

apache/dubbo-go

dubbo dubbo-go dubbogo

值得收藏的15个JavaScript语句

devpoint

JavaScript array 6月日更

面壁小钢炮 3.0 重磅发布!“无限”长文本,性能超 Kimi_AI&大模型_褚杏娟_InfoQ精选文章