diff --git a/Readme.md b/Readme.md index 10796fa..4e11488 100644 --- a/Readme.md +++ b/Readme.md @@ -21,6 +21,7 @@ | --- | --- | | **📦 应用** | [下载清单](#-下载清单) | [五分钟上手](#-五分钟上手按你的目标选应用) | [安装包须知](#-安装包通用须知) | | **📦 教程** | [1 Harness](#教程-1--deepseek-harness本仓库对应的-agent-框架) | [2 CC-Switch](#教程-2--cc-switch一键在-claude-code--codex-之间换供应商) | [3 Cursor](#教程-3--cursoride-内接自有-api-key) | [4 Claude](#教程-4--claude-desktop官方客户端订阅制) | [5 ChatGPT](#教程-5--chatgpt-desktop官方客户端订阅制) | +| **📖 概念** | [Token / 输入输出 / 缓存 / 上下文](#-概念速查token输入--输出缓存与上下文) | | **💰 定价** | [总览对比](#一总览对比) | [DeepSeek](#二deepseek按量付费) | [腾讯云](#三腾讯云-tokenhub-token-plan) | [阿里云](#四阿里云百炼-token-plan) | [小米 MiMo](#五小米-mimo-token-plan) | [Kimi](#六kimimoonshot-ai) | [智谱](#七智谱-bigmodel-glm-coding-plan) | [豆包](#八火山方舟--豆包-agent-plan) | [API 单价](#九附录按量付费-api-每-1m-tokens-单价对照) | [Akile](#十akile第三方中转聚合渠道) | | **📐 换算** | [统一横表](#十一统一口径全模型横表--100-万-token) | [11.1 口径](#111-换算口径先读这段) | [11.2 主表](#112-主表按输出单价从低到高) | [11.3 免费项](#113-免费--限时免费输出或整体免费) | [11.4 订阅折算](#114-订阅制的折算综合成本估算非清单价) | [11.5 速读](#115-速读结论) | | **📚 其他** | [数据来源](#十二数据来源清单) | [完整哈希](#附安装包校验值与完整哈希) | @@ -135,6 +136,41 @@ --- +## 📖 概念速查:Token、输入 / 输出、缓存与上下文 + +看价格表之前先弄清这几个词——后面所有表格的列名都按这套口径来。 + +- **Token(词元)**:模型处理文本的最小单位,不等于字数:中文约 1 token ≈ 1.5–2 个汉字,英文约 1 token ≈ 4 个字符,代码里 1 个符号通常算 1 个。价格表中的「100 万 Token」= 1,000,000 个这样的单位 **→ 所有单价的分母** +- **输入(Input)**:你发给模型的全部内容:系统提示、历史对话、上传文档的内容、工具/函数返回结果。**多轮对话每一轮都会把之前的上下文重新发一遍** **→ 按「输入价」计费** +- **输出(Output)**:模型生成的内容,**包含思考过程(reasoning tokens)**——多数平台把思考 token 也按输出价算,所以推理强度开到最高会明显变贵 **→ 按「输出价」计费,普遍高于输入价(常见 2–8 倍,旗舰模型多在 3–5 倍)** +- **缓存写入(Cache Write)**:首次把一段前缀写入服务端上下文缓存的一次性费用;有的按有效期分档(Kimi K3:5 分钟 ¥20 / 1 小时 ¥40 每百万 token),有的限时免费(DeepSeek、GLM、MiMo) **→ 只在首次写入时收,命中后自动续期、不再重复收** +- **缓存命中(Cache Hit)**:本次请求的开头与缓存中的前缀**完全一致**,这段输入按「缓存命中价」计费,通常只有标准输入价的 1/5 – 1/50 **→ 最有效的省钱手段** +- **缓存未命中(Cache Miss)**:前缀对不上缓存(内容变了、顺序变了、缓存过期),按**标准输入价**计费 **→ 价格表默认列出的就是这一档** +- **上下文窗口(Context Window)**:单次请求能容纳的 token 上限(输入 + 输出合计),超出就必须裁剪历史或做摘要 **→ 窗口本身不收费,但装进去的内容全都算输入 token,长上下文 = 高输入成本** +- **最大输出(Max Output)**:单次回复可生成的上限,通常远小于上下文窗口(例:1M 上下文 / 384K 最大输出) **→ 限制单次能产出多长的代码或报告** +- **Batch(批处理)**:非实时异步接口:提交后稍后取结果,用延迟换更低单价 **→ 常见为实时价 5 折,适合离线批量任务** +- **错峰 / 非高峰**:按时间分档定价:DeepSeek 错峰 = 高峰半价;智谱非高峰积分 5 折;MiMo 夜间 0.8× **→ 把批量任务排到低谷时段,直接省一半** +- **积分 / Credits / AFP**:订阅制套餐的额度单位,与 token **不是 1:1**:平台按模型类别给「抵扣系数」(智谱 GLM-5.3 输入 6.9 / 输出 24,GLM-5.3-Flash 则是 2.3 / 8) **→ 判断套餐划算与否要看系数,不能只比额度数字** +- **并发 / TPM / RPM**:并发上限、每分钟 token 数、每分钟请求数 **→ 高峰期报错多是触顶限流,而非计费问题** + +**一次请求到底怎么算钱**——以 DeepSeek `deepseek-flash`(错峰价)为例:输入 10,000 tokens(其中 8,000 命中缓存、2,000 未命中),输出 1,000 tokens。 + +| 项目 | 用量 | 单价(USD / 1M) | 小计 | +| --- | ---: | ---: | ---: | +| 输入 · 缓存命中 | 8,000 | $0.003 | $0.000024 | +| 输入 · 缓存未命中 | 2,000 | $0.15 | $0.000300 | +| 输出 | 1,000 | $0.60 | $0.000600 | +| **合计** | 11,000 | — | **$0.000924**(≈ ¥0.0062) | + +同样内容如果**全部未命中缓存**:输入 10,000 × $0.15 = $0.0015,加输出 $0.0006,合计 **$0.0021**,贵 **2.3 倍**。 +这就是为什么要把稳定不变的内容(系统提示、项目规范、代码库结构)放在前面、把每轮变化的内容放在后面——前缀越稳定,命中率越高。 + +**省钱优先级**:提高缓存命中率 > 挪到错峰时段或用 Batch > 选对模型档位 > 用订阅套餐(仅限其支持的 AI 工具内)。 + +**[↑ 返回目录](#目录)** + +--- + ## 一、总览对比 | 平台 | 产品形态 | 最低档月价 | 计量单位 | 备注 |