ADK.wang AI & 软件技术百科
全库汇聚全球 22,000+ 核心技术词条,深度引证上千本行业权威学术专著,涵盖大模型原理、云原生、架构设计与工程效能。
22,077
全量学术技术词条
9 大
核心专业领域体系
10,000+
权威专著深度引证
100%
原书精粹与工业对齐
专业技术领域分类
共 1516 篇词条权重量化
Weight Quantization
权重量化(Weight Quantization)组件。
条件机制
Conditioning Mechanism
图12-9 Stable Diffusion模型架构 Stable Diffusion的数据会在像素空间(Pixel Space)、隐空间(Latent Space)、条件机制(Conditioning
条件独立性 (A JL C)
虐黑推理 : 「 基础与学习算法 ©f(3 — © 0-^®^© 真实 DAG DAG mag PAG(mod.PC/ (PC 输出) FC 】输出) 图 9.3 从左侧的 SCM 开始,右边的三个图编码了一组条件独立性 (A JL C) 。
来指导策略
Actor
Actor-Critic算法改进了传统的策略梯度方法,采用值函数 (Critic)来指导策略(Actor)的优化,使得学习过程更加稳定和高 效。
来看看监督微调 (SFT)
厘清这些概念之后,我们来看看监督微调(SFT)。 监督微调是机器学习中优化预训练模型的关键技术,尤其在自然语言处理领域应用广泛。
来自加拿大国立科学研究所 (INRS)
年,来自加拿大国立科学研究所(INRS)的罗伯托·莫兰多蒂(Roberto Morandotti)教授团队在这个问题上有了重大突破,他们开发出了一种光学芯片,芯片上的量子频率梳可以用来同时产生多光子纠缠的量子比特状态,有望帮助量子计算机解决诸多发展道路上的...
构成向量
Vector
向量型环境状态变量 在图1.3(b)中,多个标量可以构成向量(Vector),向量可以表示环境和个体的多维特征属性,如三维空间中个体位置坐标可以用向量( x,x,x )表示。
析长序列任务中长距离注意力
Long-Range Attention
本节深入探讨动态注意力的实现原理及其在不同场景中的适应性,分 析长序列任务中长距离注意力( Long-Range Attention )机制与稀疏注 意力( Sparse Attention )机制的性能提升,同时介绍多样化位置编码 方法在模型理解长短期依...
查询向量
Query Vector
Ni 定义8.1 注意力分布: 为了从 N 个输入向量[ x ,…, x ]中选择与某个特定任务相关的信息,需要引入一个和任务相关的表示,称为查询向量(Query Vector),并通过一个打分函数来计算每个输入向量和查询向量之间的相关性。
查询字符串
Query String
可以看到,env中包含了客户端请求的所有信息,比如请求类型、客户端的User-Agent、查询字符串(Query String)以及一些rack自身的信息(这些属性都以rack.开头)。
查询文本
Query
关系评估模块通过动态归纳模块已经获取了训练集中每个类别的类向量表征,并通过语义编码模块获取了批数据集合(Batch Set)中每个查询文本(Query)的向量。
查询检索
Retriever
RAG有四个核心部件:向量数据库(Vector Database)、查询检索(Retriever)、重新排序(Re-ranking)、生成回答 (Generator)。
查询检索器
Self Query Retriever
LangChain支持多种检索算法,从简单的语义搜索到复杂的算法,如父文档检索器(Parent Document Retriever)、自查询检索器(Self Query Retriever)和合奏检索器(Ensemble Retriever)等,提供了增...
查询注意力 (MQA)
为了解决这个问题,有一种新提出的改进模型,称为多查询注意力(MQA)机制。
查询表
Lookup Table
将输入序列转化 成词嵌入的方法是从一张查询表( Lookup Table)中获取每个词元(Token)对应的向量表 示。
柳树车库
Willow Garage
柳树车库(Willow Garage),于2006年由谷歌早期的设计师斯科特·哈桑(Scott Hassan)创立。
标记掩码
Token Masking
(1)标记掩码(Token Masking):随机使用[MASK]符号屏蔽标记,与BERT模型相同。
标记模型
Claude
“nnHuman:” 用于 标记用户(你)的指令,“nnAssistant:”用于标记模型(Claude) 的生成内容。
标记符
Token
随着各类大语言模型开始提供更大的上下文窗口,我们可以一次性给出更多的文本,例如GPT-4最多可以接收包含3.2万个标记符(Token)的上下文,而2023年5月Athropic的Claude聊天机器人新版则提供了最多10万个标记符的上下文窗口,这意味着我们...
标记解析器
Tokenizer
)为了将长文本分成更小的序列,我们使用了Keras框架中的 标记解析器 (Tokenizer)类。
树思维链
ToT
树思维链(ToT) 树思维链(Tree-of-Thought,ToT),或者称为“思考之树”,来自论文“Tree of Thoughts:Deliberate Problem Solving with Large Language Models”(http...
样本提示
Zero-shot Prompt
在本章开篇的例子中,通过附加一句话使ChatGPT回复准确的技巧称为0样本提示 (Zero-shot Prompt)。
核心在于蒸馏损失
Distillation Loss
知识蒸馏的核心在于蒸馏损失(Distillation Loss)的设计,通过优化教师模型和学生模型之间的知识传递,确保学生模型能够有效学习到教师模型的潜在信息。
核心是注意力机制
Attention
Transformer架构:可以并行矩阵计算(GPU),核心是注意力机制(Attention)