ADK.wang AI & 软件技术百科
全库汇聚全球 22,000+ 核心技术词条,深度引证上千本行业权威学术专著,涵盖大模型原理、云原生、架构设计与工程效能。
22,077
全量学术技术词条
9 大
核心专业领域体系
10,000+
权威专著深度引证
100%
原书精粹与工业对齐
专业技术领域分类
共 31 篇词条美国国家航空航天局 (NASA)
这当中自然少不了美国,前脚美国总统特朗普还称“DeepSeek是很积极的技术成果”,后脚美国的权力机构就对DeepSeek展开了“全面围剿”,具体如下: ·美国国家航空航天局(NASA)发布内部备忘录,以服务器位于美国境外、存在国家安全和隐私风险为由,禁止...
大语言模型
Vicuna
大语言模型 (LLM) DeepSeek专注于开发先进的大语言模型(LLM)和相关技术,旨在通过这些技 的创新应用 术推动人工智能在多个领域的应用和创新 投资者背景与市 作为由知名私募巨头幻方量化孕育而生的公司, DeepSeek 获得了强大的资金支持和行...
活跃用户数 (MAU)
DeepSeek可以说是一个现象级的AI产品,根据“AI产品榜”网 站的数据,上线20天,DeepSeek日活跃用户数(DAU)超2000万,用户数达到 ChatGPT的40%(见图1-22)。
净资产收益率 (ROE)
运用DeepSeek完成上述财务分析的提示词示例:2024年企业的净资产为80000万元,若2024年企业获高新技术认证,所得税率下降至15%,请计算净利润、净资产收益率(ROE)的增幅,并与当前25%税率场景对比,输出差异值及政策红利结论。
通用强化 (SFT)
监督微调 学习 (2) 通用强化 ( SFT ) DeepSeek-V3-Base SFT 检查点 DeepSeek-R1 (1) 推理导向的 SFT 数据 强化学习 临时推理模型 推理数据 长链思维示例 图 A-6:推理导向的强化学习 具体分为两个步骤:...
高效长距离注意力网络 (ELAN)
图 1-4 高效长距离注意力网络( ELAN ) 在 DeepSeek-V3 中,这两种技术的结合不仅提升了模型的性能,还显著 扩展了其在长文本生成、代码补全和数学推理等任务中的适用性。
传统辅助损失
Aux-Loss-Based
图 2-5 中展示了传统辅助损失( Aux-Loss-Based )和无辅助损失( Aux- Loss-Free )两种负载均衡策略在 DeepSeek-V3 不同层级(第 9 层和第 18 层)中对专家负载分配的效果对比。
传递提示词
Prompt
( 3 ) invoke_api 方法负责通过 requests 库向 DeepSeek API 发送请求, 传递提示词( Prompt )并获取模型的响应。
大规模推理导 (SFT)
监督微调 大规模推理导向的 (SFT) 强化学习(RL-1) 步数 步数 DeepSeek-V3-Base 推理SFT检查点 临时推理模型 冷启动推理数据 (几千条) 图 A-15:冷启动数据 冷启动 与 DeepSeek-R1-Zero 不同,为了避免基...
幻方量化
High-Flyer Capital
第二节 DeepSeek背后的团队与机构 一、缘起:幻方量化 DeepSeek的故事始于幻方量化(High-Flyer Capital),一家在量化投资领域颇具影响力的机构。
总体拥有成本 (TCO)
表 3.1 DeepSeek 本地私有化部署的总体拥有成本( TCO )构成 为应对本地私有化部署的算⼒瓶颈 , 需要从算法优化、架构设计 与 能 源管理 三 ⽅⾯切⼊。
无辅助损失
Aux-Loss-Free
图 2-5 中展示了传统辅助损失( Aux-Loss-Based )和无辅助损失( Aux- Loss-Free )两种负载均衡策略在 DeepSeek-V3 不同层级(第 9 层和第 18 层)中对专家负载分配的效果对比。
服务接口 (HTTP)
通过 云 服务接口 ( API ) 接入 除了通过用户界面直接使用DeepSeek,对于开发者或者希望能够深度 定制、接入自身知识库的用户,深度求索提供了一个API开放平台。
混合专家架构
MoE
( 1 )混合专家架构( MoE )优化: DeepSeek-V3 采用最新的 MoE 架 构,通过动态路由机制实现专家选择的高效性与准确性。
预测 (MTP)
(3)多Token预测(MTP)策略:在训练过程中,DeepSeek-V3采用了多Token预测策略,即模型在每个输入Token的基础上同时预测多个未来Token,这一策略增加了训练信号的密度,提高了模型的学习效率,从而减少了所需的训练步骤和总体计算成本。
混合专家系统
MoE
表1-4 效能地图 2)创新架构的强大力量 DeepSeek能在众多人工智能工具中脱颖而出,得益于创新技术架构,包括混合专家系统(MoE)架构、强化学习优化和多模态处理能力。
低资源微调
LoRA
DeepSeek提供强大的模型微调技术,低资源微调(LoRA)、增量学习、梯度检查点机制和分布式训练框架相互配合,可为用户提供高效定制方案。
Head Attention (MLA)
architecture and the optimized Multi-Head Attention (MLA) mechanism, DeepSeek-V2 achieves
Headed Latent Attention (MLA)
algorithms have emerged including DeepSeek’s Multi-Headed Latent Attention (MLA).
专注通用人工智能 (AGI)
DeepSeek是一家专注通用人工智能(AGI)的中国科技公司,主攻大模型研发与应用。
变性学习
Causal Invariance Learning
DeepSeek-R1 通过因果 不 变性学习 ( Causal Invariance Learning ) 提取跨场景的稳定因果特征 , 例如设备退化过程中的磨损 模式 与 负载波动的解耦表示 , 使得模型在未⻅⼯况 下 仍能保持推理鲁 棒性。
嵌入表示
Embedding
腾讯云大数据2025 年度精选技术实践指南(上) 数智话 DeepSeek 启示录 - 非结构化数据的价值创造 DeepSeek 的成功验证了 嵌入表示(Embedding) 作为通用语义载体的可行性。
工作引擎
Operation Engine
工作引擎 (Operation Engine) • 输入处理 • 执行流程 • 输出规范 如何使用DeepSeek制作可视化图表?
广泛认为是通向通用人工智能 (AGI)
随着GPT系列、DeepSeek等大语言模型的迅速发展,智能体(AI Agent)技术加速普及,并被广泛认为是通向通用人工智能(AGI)的重要路径。