Skip to content

第002期-AI的消费主义与token焦虑

机械之手指向夜空烟花

我们应该为ai投入多少钱

看烟花!!!

99刀/月的grok Heavy ,我最终没有买

100刀grok heavy 开通技巧分享

99刀/月的grok Heavy ,我最终没有买

我也没想到在第一期许的愿
99刀/月的grok Heavy ,我最终没有买
竟然真的实现了,300刀/月 打完折一年1000刀。送12个月的200刀/月 cursor Ultra Plan 以及12个月的grok bot。可以说性价比满满的了。昨晚我纠结很久,最后还是放弃了。最近高强度使用cursor发现,还是cli更适合我,ide我用起来很不舒服,而且cursor的grok 4.6是阉割过的,上下文只有256k。
grok bot 也确实有趣,但我还是更想要自己定制一个投研系统,他可以作为参考,但并不会很合适。
我统计了一下,我当前一个月大概消耗4个gpt plus账号,2个SuperGrok 账号的额度是够的。使用clipro,自由度会更高。
cli使用grok build / pi /codex 。4个plus按80一个算,2个SuperGrok 算150。其自由度和可用空间是比cursor+7.5个SuperGrok要高的。cursor的cli太难用了。
在AI快速发展迭代的时代,现在的灰产空间被压缩了,正价套餐的优惠波动很大,像昨晚这样的折扣力度确实不多见。但我不想绑定在老马一条船上,现在ai这么好玩,我还是更希望自由度更高一些。
可惜了,不知道过几个月会不会打自己的脸。啧
99刀/月的grok Heavy ,我最终没有买

99刀/月的grok Heavy ,我最终没有买

从 DeepSeek 官方涨价到 OpenCode Go 套餐涨价

从 DeepSeek 官方涨价到 OpenCode Go 套餐涨价

看完梁子 5 月的那场电话对谈,我一直有一个困惑:他说的 6 个月回本,是什么价格下的 6 个月?

我花了不少 token 去计算当前大模型厂家和云厂家卖 token 到底赚不赚钱,包括 A 社和 O 社。大概结论是不赚钱,起码当前阶段 C 端不赚钱。

我也比较过 V4 Pro 和 GLM-5.2/5.3。V4 Pro 的参数量是 GLM-5.3 的一倍,激活专家模型大致上一样。凭什么 V4 Pro 比 GLM-5.2 便宜那么多?

OpenCode 当前的价格,我认为才是一个合理的、可以有毛利空间的价格。

现在的早期阶段,真实的情况是大模型厂家和用户都是亏钱的。模型厂家在补贴用户,用户在当前阶段使用的大模型能力,你从 2~3 个月后回看,一定是亏的。

这大概就是人类有趣的地方。供求双方都在投入资源,让 token 无处不在。

从DeepSeek官方涨价到opencode go套餐涨价

也许他没有想吹牛,但事实上他可能吹牛了:Anthropic 的「Mythos 2」

也许他没有想吹牛,但事实上他可能吹牛了:Anthropic 的「Mythos 2」

Anthropic要准备上市了。
很多故事会从这些人嘴巴里不断的传出来。
我相信公司内部有很强的大模型没有公布,没有公布的原因大体上
1.成本:太贵了,toB/toC都没法打平盈亏
2.规模:当前模型太大,运营的话服务器硬件支撑不起
3.防止被蒸馏,其本身是作为研发推进的最前沿模型,不可能拿出来售卖
我们要知道,曾经的claude 依靠sonnet就可以打天下,现在的sonnet已经算路边一条了。
现在的opus都会被grok 当小瘪三嘲讽的

一个极度实用的深度思考Prompt,帮你挖出最本质的答案。

一个极度实用的深度思考Prompt,帮你挖出最本质的答案。

拿来鞭笞自己,压榨想法有点用,类似grill-me
先别急着回答,也别默认我已经把问题想清楚。请先对这个问题做一次详细思考的“双向钢人论证”:
1.用最完整、最有力的方式,重述我真正想解决的问题。
2.使用钢人论证法分别给出支持我当前想法、以及反对它的最强论证。
3.找出双方真正的分歧,以及最可能改变结论的关键变量。
4.只问我一个最关键的问题。等我回答后,再给出明确判断、理由和下一步行动。
我的问题是:[粘贴你的问题]

OpenAI也许想通过押注亚洲(中国)来实现数据和营收上的突破

OpenAI也许想通过押注亚洲(中国)来实现数据和营收上的突破

去年下半年到今年上半年欠的债,要用巨额的补贴和羊毛来偿还。
而只有中国市场能支撑这么大的用户体量。
这里要注意,AI能力无限但人的注意力有上限。
GPT和Claude套餐往往是二选一的关系。
虽然从性能和体验上来说GPT已经赶上来了,
但从真实的性价比来说,当前还是Claude Code更高。
这也就意味着,O社在走和A社不一样的路。
A社专注较为单一的欧美市场,而O社更押注全球。
这让我想到晚点和陈冕的那场对话。
O社已经开始打击高并发的20x账号了,也许接下来是拼车的时代。
当前阶段OpenAI对中国人还算友好

字节推广,很克制

字节推广,很克制

已经不是第一次了。字节在推广自己的产品时,推广试用往往存在限制和阉割:比如只有付费才能体验更好的大模型,比如产品功能上的权限缺失。这种不完全的体验试用,往往很难抓到本来就没多大兴趣的羊毛党用户。这在当前的 AI 行业并不常见,大概是因为产品的底层大模型趋同性,应用层的体验差距往往很难拉大,大部分 AI 应用公司都恨不得在试用期把最极致的体验交付给潜在用户。
难以评价哪种策略更好。也许当字节真的做出一款足够强大的产品的时候,其试用才会采用放量的方式。
这种又有钱还比你省的,也许是太有钱了,他好像没其他公司那么焦虑。腾讯我认为就更焦虑。

“你:拼命奔跑,也只能留在原地。”

“你:拼命奔跑,也只能留在原地。”

“你:拼命奔跑,也只能留在原地。”

牛来了,当 Auto模式成为高频选择的时候,应用的春天就会来。

“你:拼命奔跑,也只能留在原地。”

当前的AI套餐变更太快了,包括OPenAI和XAI这样的大厂也是这样。

图片

买套餐,特别是长效套餐,就是赌的后续模型能力稳定性,这点上连谷歌都翻车了

Grok 的性价比比我想的要低,执行任务用 4.5,不需要用 4.6

Grok 的性价比比我想的要低,执行任务用 4.5,不需要用 4.6

最便宜的是 10 刀/月的 X Premium 套餐,周限额是 25 刀,月限额是 100 刀。
30 刀/月的 SuperGrok 套餐,周限额是 75 刀,月限额是 320 刀。

最近还发现用 CliPro,缓存有问题,只有 70% 左右。不知道另外两个项目怎样,等等测测看。

当前可用、性价比最高的套餐是 110 元/6 个月的 X Premium,算下来是 0.19 元/刀。
当前知道的 SuperGrok 最低价格能做到 240 元/3 个月,质保只有 1 个月;质保 3 个月是 280 元。
哪怕按 240 元计算,其也来到 0.2 元/刀。

Grok 4.5/4.6:当前费用是输入 2 美元、输出 6 美元、缓存 0.5 美元。按套餐价格算,分别是 0.4 元、1.2 元、0.1 元。

我还发现在搭配 Sol 执行任务的时候,Grok 4.5 就足够了。用 4.6 更消耗 Token,时间更长,质量不一定会更高。Grok 4.6 这次升级,我个人认为不算成功:虽然模型能力更强了,但功耗也上去了,而且效率还下来了。现在反倒有点期待 Composer 3 了。

Grok 4.5 与 Grok 4.6 性能排行榜与基准评测报告


1. 核心性能基准排行榜对比
评测基准 / 维度指标类型Grok 4.5 (High)Grok 4.6 (High)GPT-5.6 Sol (Max)Claude Fable 5 (Max)维度说明
AA Intelligence Index评分 (0-100)56616162综合智能与推理能力指数
GDPVal-AA v2Elo 天梯分1,5261,7531,7281,741实际知识工作产出与价值评估
CursorBench v3.2准确率 (%)66.7%69.9%67.2%70.5%IDE 编程辅助与多文件代码重构
DeepSWE 1.1解决率 (%)54.0%65.9%73.0%70.0%复杂真实开源仓库 Issue 自主修复
Terminal-Bench 3.0任务完成率 (%)15.7%26.0%34.6%34.1%CLI/终端复杂多步指令执行
APEX-Agents成功率 (%)47.1%57.5%56.7%59.2%自主 Agent 决策规划与工具调用
AA-BriefcaseElo 天梯分1,3131,5771,5021,574长程多文档研究与综合分析任务
Harvey LABVals准确率 (%)12.9%15.8%2.5%11.3%专业级法律、合规与复杂逻辑审查

2. 关键能力演进与架构解析
2.1 强化后训练带来的跃升
  • 推理与 Agent 规划: Grok 4.6 延续了 Grok 4.5 的基础架构,主要在 SFT(监督微调)RL(强化学习) 策略上进行了深度迭代。在长链路规划任务中,模型有效降低了自我幻觉与死循环调用率。
  • 专业垂直领域: 在法律/合规审查基准 Harvey LABVals 中录得 15.8%,对复杂条款的逻辑严谨性表现优异。
2.2 编程与工程开发实测
  • IDE 辅助:CursorBench v3.2 上达 69.9%,相比 4.5 提升 3.2 个百分点,多步代码补全和上下文理解流畅度提升明显。
  • 自主软件工程:DeepSWE 1.1 上相比 4.5 提升了近 12 个百分点(54.0% → 65.9%),但在超长链路的终端环境部署与环境排错中,距离第一梯队(GPT-5.6 Sol)仍有提升空间。

3. 规格参数与部署性价比
维度Grok 4.5Grok 4.6竞品参考 (GPT-5.6 Sol)
上下文窗口500K tokens500K tokens500K tokens
输入价格$2.00 / 1M tokens$2.00 / 1M tokens$6.00 / 1M tokens
输出价格$6.00 / 1M tokens$6.00 / 1M tokens$18.00 / 1M tokens
适用场景日常对话、通用生成长程 Agent、代码工程、专业知识挖掘极端复杂长链路 Agent、全自主运维

而且 Grok 会降智,有很多用户反映其降智的问题。估计是用来量化的版本去滥竽充数。

Grok 的性价比,比我想的要低,执行任务用 4.5,不需要用 4.6

哈,不支持sub2api了。这是准备为后续的封号做铺垫么?

哈,不支持sub2api了。这是准备为后续的封号做铺垫么?

sub2api的用户场景还是中转吧。
之前他说鼓励大家用clipro把codex反代到claude code上去用。
感觉不容易的。怎么区分是clipro还是sub2api呢?
还有拼车怎么算?

个人笔记分享 · 非投资建议,据此决策风险自负

闽ICP备2026032381号-1闽公网安备35018302000421号