ADK.wang AI & 软件技术百科
全库汇聚全球 22,000+ 核心技术词条,深度引证上千本行业权威学术专著,涵盖大模型原理、云原生、架构设计与工程效能。
22,077
全量学术技术词条
9 大
核心专业领域体系
10,000+
权威专著深度引证
100%
原书精粹与工业对齐
专业技术领域分类
共 63 篇词条探测任务如命名实体 (NER)
探测任务如命名实体识别(NER)可以 揭示 Transformer 模型如何表示语言。
掩盖策略改为全字掩盖策略 (WWM)
图9.5 NEZHA模型的预训练策略 首先,NEZHA预训练模型通过在Transformer模型中使用相对位置编码来补充BERT模型因矩阵转化而消失的位置信息;其次,其通过将随机掩盖策略改为全字掩盖策略(WWM),如图9.6所示,进而帮助模型在预训练过程中...
核心是注意力机制
Attention
Transformer架构:可以并行矩阵计算(GPU),核心是注意力机制(Attention)
模型应用子掩码语言建模 (MLM)
将模型应用子掩码语言建模(MLM)下游任务 第一步是描述我们将要构建的 Transformer 模型。
理解任务 (NLU)
BERT模型只使用了Transformer中的编码器,更擅长处理自然语言理解任务(NLU)。
积木工厂
Transformer
积木工厂(Transformer) 想象你有一个超级积木工厂,专门生产会讲故事的机器人🤖。
稀疏注意力模式
Sparse Attention Pattern
O n (1)稀疏注意力模式(Sparse Attention Pattern) 2 如图5.2所示,Sparse Transformer的核心设计理念是使用稀疏注意 力模式。
空洞卷积 (IDCNN)
常用的预训练模型有Word2Vec、BERT、NEZHA等,用来表征Token的语义信息;而下接结构如双向长短时记忆(BiLSTM)网络、双向门控循环单元(BiGRU)、R-Transformer [1] 、空洞卷积(IDCNN) [2] 等模型结构则是用...
空间变换器
SpatialTransformer
可以看到,无论是上采样层还是下采样层,都主要由空间变换器(SpatialTransformer)和残差网络块(ResnetBlock2D)构成。
结构如双向长短时记忆
BiLSTM
常用的预训练模型有Word2Vec、BERT、NEZHA等,用来表征Token的语义信息;而下接结构如双向长短时记忆(BiLSTM)网络、双向门控循环单元(BiGRU)、R-Transformer [1] 、空洞卷积(IDCNN) [2] 等模型结构则是用...
行矩阵 (GPU)
Transformer架构:可以并行矩阵计算(GPU),核心是注意力机制(Attention)
解码注意力
EncoderGDecoder Attention
Transformer从结构上看依然是编码G解码架构,由自注意力(SelfGAttention)、编码G解码注意力(EncoderGDecoder Attention)和前馈神经网络(Feed Forward Neural Network)构成。
通用大语言模型 (LLM)
在文本生成方面,以OpenAI的GPT-4o为例,详细介绍了通用大语言模型(LLM)的工作原理,包括其基于 Transformer架构的生成机制、上下文编码、自注意力机制以及预训练和微调过程。
非序列问题 (CV)
关注这几年科研进展的读者或许早就知道,Transformer在序列建模问题(NLP)甚至非序列问题上(CV)都获得了广泛应用,相关研究已经热火朝天了。
面对命名实体 (NER)
我们将探索 Transformer 在面对命名实体识别(NER)和问答任务时的潜力。