ADK.wang 统一知识工程 · 权威专著深度引证

ADK.wang AI & 软件技术百科

全库汇聚全球 22,000+ 核心技术词条,深度引证上千本行业权威学术专著,涵盖大模型原理、云原生、架构设计与工程效能。

22,077

全量学术技术词条

9 大

核心专业领域体系

10,000+

权威专著深度引证

100%

原书精粹与工业对齐

人工智能与大模型
📚 26 本专著

解码器

Transformer decoder

常见的自编码器的网络结构如图10.2所示,最简单的自编码器只有3层结构,中间的隐藏层才是所需要关注的地方,以隐藏层为界限,左边为编码器(Encoder),右边为解码器(Decoder),所以在训练过程中,输入才能在经过编码后再解码,还原成原来的模样。

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 26 本专著

注意力机制

Self-Attention Mechanism

)Transformer Transformer 主要用在语言模型(LM)上,Transformer 是一个完全依赖于自注意力机制 (Self-Attention)来计算其输入和输出的表示的转换模型,可以并行同时处理所有的输入 数据,模仿人类联系上下文的习...

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 25 本专著

机制

VMware vSAN

列表4.6 GPT的变压器块组件 from chapter03 import MultiHeadAttention 给定的代码定义了一个PyTorch中的TransformerBlock类,该类包含一个多头注意力 机制(MultiHeadAttention...

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 12 本专著

语言模型

Unigram Language Model

确保已安装以下依赖: pip install torch transformers numpy pandas scikit-learn 代码实现: 运行结果如下: 代码解析如下: (1)模型定义:使用预训练语言模型(BERT)作为特征提取器,通过全连接层完...

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 12 本专著

条件随机场 (CRF)

c、BERT、NEZHA等,用来表征Token的语义信息;而下接结构如双向长短时记忆(BiLSTM)网络、双向门控循环单元(BiGRU)、R-Transformer [1] 、空洞卷积(IDCNN) [2] 等模型结构则是用来补充文本序列的方向信息;条件随...

难度: ★★★ 阅读: 8分钟
查看引证 →
后端开发与架构
📚 7 本专著

归一化

Layer Normalization

读者从图4.1中可以看到Transformers的内部结构都由Ashish Vaswani等 [2] 提出的自注意层(Self-Attention Layer)和层归一化(Layer Normalization)的堆叠而产生。

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 7 本专著

循环单元 (GRU)

常用的预训练模型有Word2Vec、BERT、NEZHA等,用来表征Token的语义信息;而下接结构如双向长短时记忆(BiLSTM)网络、双向门控循环单元(BiGRU)、R-Transformer [1] 、空洞卷积(IDCNN) [2] 等模型结构则是用...

难度: ★★★ 阅读: 8分钟
查看引证 →
信息安全与密码学
📚 7 本专著

局部 (TLS)

通过本章的学习,你将看到任务无关的 Transformer 世界已演变成一个充满想象 力和创造力的宇审, 本章涵盖以下主题, ●如何选择Transformer 模型 ◆ Reformer Transformer 模型 ● 局部敏感哈希(LSH)

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 5 本专著

剪枝

Pruning

图9.8 LLM.int8()示意图 (图片来源:论文“LLM.int8:8- bitMatrixMultiplicationforTransformersatScale”) 9.5 SparseGPT 剪枝 算法 剪枝(Pruning)是一种模型压缩方法...

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 5 本专著

文本 (TXT)

预训练的 预训练的 可训练的 ViT Q-Former LLM 查询式 Transformer 图 9-16:Q-Former 作为连接视觉(ViT)与文本(LLM)的桥梁,是系统中唯一需要训练的核心组件 为实现跨模态对接, Q-Former 在架构设计上...

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 5 本专著

混合专家模型

MoE

图22.1.1 神经网络模型越来越复杂,包括混合专家模型(MOE)、生成对抗网络(GAN)、注意力 模型(Attention Transformer)等。

难度: ★★★ 阅读: 8分钟
查看引证 →
机器学习与算法
📚 4 本专著

前馈神经网络

Feed-Forward Neural Network

Transformer从结构上看依然是编码G解码架构,由自注意力(SelfGAttention)、编码G解码注意力(EncoderGDecoder Attention)和前馈神经网络(Feed Forward Neural Network)构成。

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 4 本专著

软提示

Soft Prompts

附加法有两种实现方式,一种是适配器 (Adapters),在Transformer子层后面加入小的全连接网络;另一种是 软提示(Soft Prompts),在输入层前面构造一段可调的前缀向量。

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 4 本专著

Trained Transformer (GPT)

erstes generatives Pre-Trained Transformer (GPT)-Modell im Juni 2018 auf

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 4 本专著

变换器

Transformer

DummyGPTModel 类中的模型架构包括标记和位置嵌入、 Dropout、一系列变换器块( DummyTransformerBlock )、最终的层归一化 ( DummyLayerNorm )和线性输出层( out_head )。

难度: ★★★ 阅读: 8分钟
查看引证 →
人工智能与大模型
📚 3 本专著

北京智源人工智能研究院 (BAAI)

这只是一场越来越大的模型竞赛的开始:Google 的Switch Transformer( https://homl.info/switch ) (于2021年1月推出)使 用了1万亿个参数,但很快又出现了更大的模型,例如北京智源人工智能研究院 (BAAI...

难度: ★★★ 阅读: 8分钟
查看引证 →
机器学习与算法
📚 3 本专著

统计语言模型

N-gram

核心知识点回顾: - 模型演进与核心架构:本章追溯了从统计语言模型 (N-gram) 到神经网络模型 (RNN, LSTM),再到奠定现代 LLM 基础的 Transformer 架构。

难度: ★★★ 阅读: 5分钟
查看引证 →
人工智能与大模型
📚 3 本专著

转化器

Transformer

scikit-learn中的大部分函数可以归为估计器(Estimator)和转化器(Transformer)两类:估计器主要用于数据的预测或回归,相关算法属于监督学习的范畴;转化器用于数据标准化、降维以及特征提取等,相关算法属于无监督学习的范畴。

难度: ★★★ 阅读: 5分钟
查看引证 →
人工智能与大模型
📚 2 本专著

机器翻译 (NMT)

现在让我们看一下NLP的另一个重要任务:神经 机器翻译(NMT),首先使用一个纯编码器-解码器模型,然后使用注 意力机制对其进行改进,最后再看一下优秀的Transformer架构。

难度: ★★★ 阅读: 5分钟
查看引证 →
人工智能与大模型
📚 2 本专著

算子组合技术

Graph

集成Transformer 高性能算子加速库ATB,提 供基础高性能算子和高效的算子组合技术(Graph),便于模型加速。

难度: ★★★ 阅读: 5分钟
查看引证 →
人工智能与大模型
📚 2 本专著

状态空间模型 (SSM)

例如,新兴的Mamba模型采用了基于状态空间模型(SSM)的选择性状态空间方法,成功将注意力机制的计算复杂度降低到线性水平(O(n)),同时保持了与传统Transformer相当的性能,这种算法突破使得处理超长文本和音频序列变得更加高效。

难度: ★★★ 阅读: 5分钟
查看引证 →
人工智能与大模型
📚 2 本专著

Regressive Transformers (BART)

and Auto-Regressive Transformers (BART) family

难度: ★★★ 阅读: 5分钟
查看引证 →
人工智能与大模型
📚 2 本专著

Sentence Transformers (SBERT)

Sentence Transformers (SBERT): Sentence Transformers are deep learning models created to produce high-quality vector representat...

难度: ★★★ 阅读: 5分钟
查看引证 →
人工智能与大模型
📚 2 本专著

Trained Transformers (GPT)

(GAN) and Generative Pre-­Trained Transformers (GPT) in Cybersecurity. 2024 Sixth International

难度: ★★★ 阅读: 5分钟
查看引证 →
显示第 1 / 3 页,共 63 条记录
← 上一页 1 / 3 下一页 →