当前位置：首页 > 元宇宙 > AI

AI 架构 Transformer 再进化：谷歌新方法突破长文本处理，注意力模块内存需求可降至 1 47

来源：责编：时间：2024-10-16 15:25:09 142观看

导读 10 月 9 日消息，科技媒体 marktechpost 昨日（10 月 8 日）发布博文，报道称谷歌公司推出了选择性注意力（Selective Attention）方法，可以提高 Transformer 架构模型的性能。Transformer 架构简介Transformer 是一种革命

10 月 9 日消息，科技媒体 marktechpost 昨日（10 月 8 日）发布博文，报道称谷歌公司推出了选择性注意力（Selective Attention）方法，可以提高 Transformer 架构模型的性能。

Transformer 架构简介

Transformer 是一种革命性的神经网络架构，由谷歌在 2017 年提出，主要用于处理序列数据，特别是在自然语言处理（NLP）领域。

Transformer 的核心是自注意力机制，允许模型在处理输入序列时捕捉词与词之间的关系，让模型能够关注输入序列中的所有部分，而不仅仅是局部信息。

Transformer 由多个编码器和解码器组成。编码器负责理解输入数据，而解码器则生成输出。多头自注意力机制使模型能够并行处理信息，提高了效率和准确性。

Transformer 架构模型挑战

Transformer 架构的一大挑战是它们在处理长文本序列时效率低下，由于每个标记与序列中的每个其他标记都相互作用导致二次复杂度，这就导致随着上下文长度的增加，计算和内存需求呈指数增长。

现在解决这一问题的方法包括稀疏注意力机制（sparse attention mechanisms），它限制了标记之间的交互数量，以及通过总结过去信息来减少序列长度的上下文压缩技术。

不过这种方法是通过减少在注意力机制中考虑的标记数量达成的，因此通常以性能为代价，可能会导致上下文关键信息丢失。

谷歌新方法

谷歌研究的研究人员提出了一种名为选择性注意的新方法，可以动态忽略不再相关的标记，从而提高 Transformer 模型的效率。

选择性注意力使用软掩码矩阵来确定每个标记对未来标记的重要性，减少对不重要标记的关注。

研究表明，配备选择性注意的 Transformer 架构模型在多个自然语言处理任务中表现出色，同时显著降低了内存使用和计算成本。

例如，在拥有 1 亿参数的 Transformer 模型中，注意力模块的内存需求在上下文大小为 512、1024 和 2048 个 tokens 时分别减少至 1/16、1/25 和 1/47。所提方法在 HellaSwag 基准测试中也优于传统 Transformer，对于较大的模型规模实现了高达 5% 的准确率提升。

选择性注意力允许构建更小、更高效的模型，在不损害准确性的情况下，显著减少内存需求。

附上参考地址

Selective Attention Improves Transformer

This AI Paper from Google Introduces Selective Attention: A Novel AI Approach to Improving the Efficiency of Transformer Models

本文链接：//www.dmpip.com//www.dmpip.com/showinfo-45-8626-0.htmlAI 架构 Transformer 再进化：谷歌新方法突破长文本处理，注意力模块内存需求可降至 1 47

声明：本网页内容旨在传播知识，若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。邮件：2376512515@qq.com

上一篇：仅靠微软无法满足激增的 AI 计算需求，OpenAI 被曝和甲骨文合作

下一篇：消息称 Kimi AI 助手内测深度推理功能，月之暗面有团队国庆加班 7 天 3 倍工资

标签：

热门焦点

数字虚拟人23年最新变化！

作者：小资来源：米塔之家自2021年元宇宙“爆炸”后，作为现实世界连接元宇宙的媒介之一，大批虚拟人跑步入场。到了2022年底，据天眼查数据显示，我国目前企业名称或经营范围
茅台的元宇宙App火了，也被骂惨了

元宇宙从概念走向大众生活，并不是一件简单的事情。技术、世界观、填充内容、载体形式，每一个环节都需要层层叠叠的逻辑。但正如赛博朋克奠基人威廉·吉布
字节跳动，刚刚投了一位虚拟女生

今年第一笔虚拟人融资出炉了。投资界获悉，杭州李未可科技有限公司显示发生股东变更，新增字节跳动关联公司北京量子跃动科技有限公司。今天公司方面正式确认，本轮
“元宇宙”里过大年，《迷你世界》在做一场怎样的实验？

2021年是游戏行业不确定性急剧上升的一年。一方面游戏正风光无限，腾讯等大厂更加密集地投资动作，让游戏创投市场异常火热，"元宇宙"概念的大放异彩，更是吸引了Netfl
企业热、用户冷，元宇宙第一站将是“营销场”？

如果说2021年底什么最火热，那元宇宙当之无愧。“万物皆可元宇宙”似乎成为新的流行语，在广告中也常常听到“社交元宇宙”“购物元宇宙”等等。就在近日，有消息传
2022年的Web3：定义概念并开创新范式

Web3 是关于加密和区块链应该如何使用的概念，因为它是加密圈的一个离散子领域。社区机会将呈指数级增长，扩大这些子行业的人口统计范围。追求 Web3 项目的组织仍
元宇宙是数字共识生态的集成逻辑表达

作者: 李鸣元宇宙是数字共识生态的集成逻辑表达，是以区块链技术为核心的可信数字化价值交互网络，是基于Web3.0技术体系和运作机制支撑下的数字新生态。本体论是
NFT Insider #47：YGG发布2021Q4社区报告，GameFi领域1月份获超10亿美元融资

引言：NFT Insider由WHALE社区、BeepCrypto联合出品，浓缩每周NFT新闻，为大家带来关于NFT最全面、最新鲜、最有价值的讯息。每期周报将从NFT市场数据，艺术新闻类，游戏
GameFi 深度解析，元宇宙内容雏形显现

GameFi=Game（游戏）+Defi（去中心化金融），核心特点为“Play to Earn”。通过技术与去中心化价值观赋能，GameFi 游戏资产化身为NFT 和代币上链，具备了可验证性和流通性；开