数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 40|回复: 1

[科技] Maple-Preview-20B-A1B登场:iPhone上运行达127 tokens/s

[复制链接]
发表于 昨天 23:25 | 显示全部楼层 |阅读模式

爱科技、爱创意、爱折腾、爱极致,我们都是技术控

您需要 登录 才可以下载或查看,没有账号?立即注册

x
美国独立 AI 研究实验室 DeepGrove 昨日(8 月 5 日)发布博文,发布名为 Maple-Preview 的轻量 AI 模型,在 iPhone(原文并未明确具体机型)上运行可以达到 127 tokens/s,是 Bonsai 27B (9.6 tokens/s) 的约 13 倍。
IT之家附上相关对比视频如下:
Maple-Preview 模型输出约为 127 tokens/s Bonsai 27B(9.6tokens/s)
在模型规模方面,Maple-Preview 的总参数量为 202 亿个,采用混合专家(MoE)架构,激活参数量为 14.9 亿个。
DeepGrove 表示,目前 AI 行业针对本地端侧主要依赖量化技术,但这种方式存在根本性问题,严重影响模型的性能和效率。
DeepGrove 公司提出“三值权重”(ternary-weight)方案,将权重约束并量化为三值({-1, 0, 1})),大幅降低了内存占用与计算带宽需求,该模型包含 24 层、256 个专家(8 个活跃专家),并采用 3:1 SWA-512:GA 混合注意力机制。
在能力展示上,Maple-Preview 在 MacBook Pro(M5 Pro)上完成 IMO 2024 P1,结果为 7/7,运行速度 281.5 tokens/s。
在长上下文场景下,Maple-Preview 也强调内存控制能力。相关图表把 context length(上下文长度)与维持上下文所需的额外内存占用放在同一坐标系中。结果显示,即便处理 131,000 tokens,Maple-Preview 的内存占用仍只有 7.69GB。
DeepGrove 表示,Maple-Preview 目前仍处于 preview stage(预览阶段),后续还会继续改进。公司同时希望构建一套系统,让 AI 模型能根据对话内容自动调整,并针对单个用户做优化。

发表于 8 小时前 | 显示全部楼层
游客请登录后查看回复内容
回复 支持 反对

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-8-7 08:28 , Processed in 0.109200 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表