Felo 发布 GPT-6 Luna:$0.10/百万输入 Token 的高性价比推理引擎

ADK Felo官方 / ADK编译 2026-09-24 4 分钟 156 次浏览
速览导读 / Summary

Felo 正式推出 GPT-6 Luna 系列,以 $0.10/百万输入 Token 的极致价格提供 1.05M Token 上下文窗口及完整推理能力。该模型专为高频分类、信息抽取及 Agent 子任务设计,支持结构化输出与视觉分析。文章通过真实场景测算,展示了其在大规模并发下的成本优势,并提出了“廉价模型初筛 + 专家模型复核”的级联架构策略,帮助开发者在保持高可靠性的同时大幅降低 AI 应用运营成本。

输入价格 $0.10 / 1M tokens 相比旗舰版大幅降价
上下文窗口 1.05M tokens 与 GPT-6 全系保持一致
支持能力 Reasoning, Tool Calling, Vision 完整保留高级功能

Key Insights / 核心看点

  • 1 推出 GPT-6 Luna 新模型,输入成本低至 $0.10/百万 Token,仅为旗舰版的十分之一。
  • 2 保留 1.05M Token 上下文窗口及推理、工具调用、视觉分析等全栈能力,打破低价低配魔咒。
  • 3 通过级联架构(Cascade Pattern)策略,实现廉价模型初筛 + 专家模型复核的成本最优解。
  • 4 明确界定适用边界,建议将 Luna 用于高频、可验证的任务,避免其在长逻辑链中传播错误。

Felo 发布 GPT-6 Luna:$0.10/百万输入 Token 的高性价比推理引擎

在 AI 应用从“尝鲜”转向“规模化”的关键节点,成本控制往往决定了产品的生死。Felo 近日在其官方博客宣布推出 GPT-6 Luna,这是 GPT-6 系列中定位最底端的“快、省”层级,定价仅为旗舰版 GPT-6 Astra 的十分之一,且保留了完整的推理与工具调用能力。

核心突破:价格与能力的完美平衡

GPT-6 Luna 的核心价值在于打破了“低价必然低配”的行业迷思。

  • 极致定价:输入 $0.10/百万 Token,输出 $0.50/百万 Token。
  • 全功能保留:与旗舰版共享 1.05M Token 上下文窗口,支持 Reasoning(推理)、Tool Calling(工具调用)、Structured Output(结构化输出/JSON)、Streaming(流式响应) 及 Vision(视觉分析)。
  • 性能表现:强调“Fast”延迟,专为高频调用场景优化。

这意味着,开发者可以用不到一杯咖啡的钱,处理百万级的输入数据,且无需牺牲模型的复杂逻辑处理能力。

实战测算:高频场景下的成本优势

Felo 通过四个典型的高频工作负载,量化了 Luna 的经济价值(注:以下数据为估算,非基准测试):

  1. 大规模分类 (Classification):处理 100 万条支持工单(每条约 300 输入 Token + 20 输出 Token 标签),总成本仅需 $40(约 4 美分/千条)。
  2. 高频对话 (Chat):支持 5 万次对话(每次 8 轮,每轮 1500 输入/250 输出 Token),总成本约 $110。
  3. 批量信息抽取 (Extraction):处理 20 万份文档(每份 6000 输入 Token,生成 400 Token JSON),总成本 $160。
  4. Agent 子任务循环:月度调用量达 10 亿输入/2 亿输出 Token,仅需 $200 即可支撑整个“读取文件并汇报”的底层逻辑层。

相比之下,若使用旗舰版模型处理同等负载,成本将呈数量级上升。Luna 的存在,正是为了填补那些“量大、价低、容错可控”的中间地带。

架构建议:级联策略 (Cascade Pattern)

Felo 官方强调,Luna 的最佳用法并非“全面替代”,而是构建 级联架构:

  1. 初筛层:让 Luna 处理所有请求,利用其快速性和低成本进行初步分类、路由或提取。
  2. 验证层:建立严格的 Schema 校验、枚举匹配或置信度阈值。若 Luna 输出符合预期,直接放行;若存疑,则触发升级。
  3. 复核层:仅将高风险或复杂案例(如架构决策、高价值分析)路由至 GPT-6 Sol 或 Astra 进行最终确认。

这种模式将模型成本转化为可控的“调节旋钮”,既利用了廉价模型的高吞吐量,又通过工程手段确保了最终输出的可靠性。

适用边界与警示

尽管 Luna 性能强大,但并非万能。官方明确指出了其不适用场景:

  • 长horizon 规划:涉及多步推理且一步错误会导致后续全盘皆输的任务。
  • 无复核的高风险决策:人类将直接依据结果采取行动且无法二次验证的场景。
  • 复杂代码库架构设计:需要深度逻辑推导的任务。

核心原则:将 Luna 部署在“错误可被检测”的环节,将复杂的推理步骤留给 Sol 或 Astra。廉价模型之所以便宜,是因为它们在硬推理上稍显薄弱,而非读取或格式化能力不足。

“廉价模型之所以便宜,是因为它们在硬推理上稍显薄弱,而非读取或格式化能力不足。将 Luna 部署在‘错误可被检测’的环节,将复杂的推理步骤留给 Sol 或 Astra。”


注:原文末尾提及的 Luna Pro 版本因内容截断未完整展示,此处暂不展开。

“The cheapest tier in the lineup is usually the one doing the most work.”

— Felo API 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo AI 发布无拍摄电商视频广告 SOP:单图生成 12 变体测试矩阵

AdsTurbo AI 推出针对独居电商卖家的‘无拍摄视频广告工作流’,旨在通过单一产品图和核心卖点,快速生成 12 种不同变体的短视频广告。该 SOP 强调结构化输入与模块化脚本,利用 3x2x2 组合矩阵实现高效 A/B 测试,帮助卖家在不依赖传统拍摄团队的情况下,快速验证不同钩子(Hook)、证明点(Proof)和行动号召(CTA)的转化率,大幅降低试错成本。

AdsTurbo AI官方 / ADK编译 3 分钟
search · 免费
★ 5.0 · 120评测
F

Felo

免费AI智能搜索引擎,支持社交联网搜索和多语种问答结果

Felo是免费AI智能搜索引擎,支持社交联网搜索和多语种问答结果。用户可以自然语言提问,Felo能理解并分解问题,同时提供中文和英文搜索结果。Felo以分块形式展示答案,每块都有详细内容和来源链接。Felo还提供社交搜索、专业搜索和主题问答功能,满足不同用户的需求。Felo Pro订阅服务每月14.99美元,提供100次专业搜索和多种AI模型选择。

查看 Felo 使用教程与功能