来源:环球网

【环球网科技综合报道】6月11日,谷歌这边正式放出了一个新东西——开放人工智能模型DiffusionGemma。跟市面上常见的那些大语言模型不同,它走的是一条新路子:基于文本扩散机制。这带来的直接好处是,在本地设备上进行AI推理时,速度可以飙到传统自回归模型的4倍。对于端侧、本地化的人工智能应用来说,这可是一个相当实用的优化选项。


现在主流的模型,像GPT、Gemini这些,走的都是自回归路线。怎么个意思呢?就是一个字一个字地按顺序生成,在云端批量处理的时候很稳定。但一旦放到本地推理,受限于硬件内存带宽,计算资源的消耗就成了个大问题。而DiffusionGemma则完全不同,它不这么一个个地来。它的做法是:先给数据加上噪声,然后通过逐步去噪,把整个文本单元并行地生成出来,同时还能对整个输出效果进行全局优化。这种方式特别适配本地那种带宽有限的运行环境,速度优势一下就凸显出来了。

根据官方介绍,DiffusionGemma的整体能力跟同系列的Gemma 4模型基本持平,在保证了高效推理的同时,内容质量也没落下。还有一个特点:它支持在生成过程中进行迭代纠错,输出的稳定性和一致性会更强。具体到效率上,采样速率能达到每秒1479个文本单元,生成一次只需要0.84秒,可以说是效率拉满了。

在综合性能测试中,这个模型的表现可以说是各有千秋。代码生成方面,它在LiveCodeBench、BigCodeBench、HumanEval这三项测试里分别拿下了30.9%、45.4%和89.6%的成绩,整体来看跟Gemini 2.0 Flash-Lite不相上下。数学推理这块,DiffusionGemma在AIME 2025测试中得了23.3%,比同期对比的模型都要好,这充分说明扩散架构在数理推理任务上潜力不小。当然,也不是没有短板。在科学推理和高难度综合推理相关的测试里,它的成绩暂时还比不上主流的对比模型,还有提升空间。

硬件适配方面,DiffusionGemma的架构设计对英伟达GPU的并行计算性能挖掘得很充分。实测数据挺有说服力的:在单块H100 GPU环境下,模型每秒可以生成1000个文本单元;在DGX Spark设备上,速率是每秒150个文本单元;而在DGX Station设备上,生成速度能飙到每秒2000个文本单元。整体来看,速度大约是相同运行条件下自回归模型的4倍。

值得一提的是,DiffusionGemma已经按照Apache 2.0开源协议对外开放了。感兴趣的开发者可以直接去Hugging Face平台下载模型权重,进行二次开发和落地应用。这事儿,对于推动本地AI应用的发展来说,无疑是个值得关注的信号。

本文转载于:https://www.163.com/dy/article/KV50F11Q0514R9OJ.html 如有侵犯,请联系zhengruancom@outlook.com删除。
免责声明:正软商城发布此文仅为传递信息,不代表正软商城认同其观点或证实其描述。