ADK.wang AI & 软件技术百科
全库汇聚全球 22,000+ 核心技术词条,深度引证上千本行业权威学术专著,涵盖大模型原理、云原生、架构设计与工程效能。
22,077
全量学术技术词条
9 大
核心专业领域体系
10,000+
权威专著深度引证
100%
原书精粹与工业对齐
专业技术领域分类
共 63 篇词条解码器
Transformer decoder
常见的自编码器的网络结构如图10.2所示,最简单的自编码器只有3层结构,中间的隐藏层才是所需要关注的地方,以隐藏层为界限,左边为编码器(Encoder),右边为解码器(Decoder),所以在训练过程中,输入才能在经过编码后再解码,还原成原来的模样。
注意力机制
Self-Attention Mechanism
)Transformer Transformer 主要用在语言模型(LM)上,Transformer 是一个完全依赖于自注意力机制 (Self-Attention)来计算其输入和输出的表示的转换模型,可以并行同时处理所有的输入 数据,模仿人类联系上下文的习...
机制
VMware vSAN
列表4.6 GPT的变压器块组件 from chapter03 import MultiHeadAttention 给定的代码定义了一个PyTorch中的TransformerBlock类,该类包含一个多头注意力 机制(MultiHeadAttention...
语言模型
Unigram Language Model
确保已安装以下依赖: pip install torch transformers numpy pandas scikit-learn 代码实现: 运行结果如下: 代码解析如下: (1)模型定义:使用预训练语言模型(BERT)作为特征提取器,通过全连接层完...
条件随机场 (CRF)
c、BERT、NEZHA等,用来表征Token的语义信息;而下接结构如双向长短时记忆(BiLSTM)网络、双向门控循环单元(BiGRU)、R-Transformer [1] 、空洞卷积(IDCNN) [2] 等模型结构则是用来补充文本序列的方向信息;条件随...
归一化
Layer Normalization
读者从图4.1中可以看到Transformers的内部结构都由Ashish Vaswani等 [2] 提出的自注意层(Self-Attention Layer)和层归一化(Layer Normalization)的堆叠而产生。
循环单元 (GRU)
常用的预训练模型有Word2Vec、BERT、NEZHA等,用来表征Token的语义信息;而下接结构如双向长短时记忆(BiLSTM)网络、双向门控循环单元(BiGRU)、R-Transformer [1] 、空洞卷积(IDCNN) [2] 等模型结构则是用...
局部 (TLS)
通过本章的学习,你将看到任务无关的 Transformer 世界已演变成一个充满想象 力和创造力的宇审, 本章涵盖以下主题, ●如何选择Transformer 模型 ◆ Reformer Transformer 模型 ● 局部敏感哈希(LSH)
剪枝
Pruning
图9.8 LLM.int8()示意图 (图片来源:论文“LLM.int8:8- bitMatrixMultiplicationforTransformersatScale”) 9.5 SparseGPT 剪枝 算法 剪枝(Pruning)是一种模型压缩方法...
文本 (TXT)
预训练的 预训练的 可训练的 ViT Q-Former LLM 查询式 Transformer 图 9-16:Q-Former 作为连接视觉(ViT)与文本(LLM)的桥梁,是系统中唯一需要训练的核心组件 为实现跨模态对接, Q-Former 在架构设计上...
混合专家模型
MoE
图22.1.1 神经网络模型越来越复杂,包括混合专家模型(MOE)、生成对抗网络(GAN)、注意力 模型(Attention Transformer)等。
前馈神经网络
Feed-Forward Neural Network
Transformer从结构上看依然是编码G解码架构,由自注意力(SelfGAttention)、编码G解码注意力(EncoderGDecoder Attention)和前馈神经网络(Feed Forward Neural Network)构成。
软提示
Soft Prompts
附加法有两种实现方式,一种是适配器 (Adapters),在Transformer子层后面加入小的全连接网络;另一种是 软提示(Soft Prompts),在输入层前面构造一段可调的前缀向量。
Trained Transformer (GPT)
erstes generatives Pre-Trained Transformer (GPT)-Modell im Juni 2018 auf
变换器
Transformer
DummyGPTModel 类中的模型架构包括标记和位置嵌入、 Dropout、一系列变换器块( DummyTransformerBlock )、最终的层归一化 ( DummyLayerNorm )和线性输出层( out_head )。
北京智源人工智能研究院 (BAAI)
这只是一场越来越大的模型竞赛的开始:Google 的Switch Transformer( https://homl.info/switch ) (于2021年1月推出)使 用了1万亿个参数,但很快又出现了更大的模型,例如北京智源人工智能研究院 (BAAI...
统计语言模型
N-gram
核心知识点回顾: - 模型演进与核心架构:本章追溯了从统计语言模型 (N-gram) 到神经网络模型 (RNN, LSTM),再到奠定现代 LLM 基础的 Transformer 架构。
转化器
Transformer
scikit-learn中的大部分函数可以归为估计器(Estimator)和转化器(Transformer)两类:估计器主要用于数据的预测或回归,相关算法属于监督学习的范畴;转化器用于数据标准化、降维以及特征提取等,相关算法属于无监督学习的范畴。
机器翻译 (NMT)
现在让我们看一下NLP的另一个重要任务:神经 机器翻译(NMT),首先使用一个纯编码器-解码器模型,然后使用注 意力机制对其进行改进,最后再看一下优秀的Transformer架构。
算子组合技术
Graph
集成Transformer 高性能算子加速库ATB,提 供基础高性能算子和高效的算子组合技术(Graph),便于模型加速。
状态空间模型 (SSM)
例如,新兴的Mamba模型采用了基于状态空间模型(SSM)的选择性状态空间方法,成功将注意力机制的计算复杂度降低到线性水平(O(n)),同时保持了与传统Transformer相当的性能,这种算法突破使得处理超长文本和音频序列变得更加高效。
Regressive Transformers (BART)
and Auto-Regressive Transformers (BART) family
Sentence Transformers (SBERT)
Sentence Transformers (SBERT): Sentence Transformers are deep learning models created to produce high-quality vector representat...
Trained Transformers (GPT)
(GAN) and Generative Pre-Trained Transformers (GPT) in Cybersecurity. 2024 Sixth International