外观
Emacs 社区日报 2026-08-18
约 7128 字大约 24 分钟
2026-08-18
自动整理自 Telegram 讨论组,每天更新。内容为 AI 摘要,仅作信息索引与回顾。
Emacs 中文讨论组
🎯 核心热点与专题探讨
【专题】Emacs 的 GUI 边界:视频播放、超大图渲染与 Windows 深色模式
今天群内围绕“Emacs 能不能承担更多 GUI/媒体能力”形成了一条断断续续的线索。
- 视频播放:有人想把 video player 搬进 Emacs,但意识到“好像挺困难的”。随后有人想起被遗忘的
pale包,认为可以接 GStreamer 或 libmpv。κόσμος 还挖出 2021 年 emacs-devel 上关于 gstreamer + xwidget 的旧讨论,建议可以复兴这个路线。 - 超大图渲染:有人问 Emacs 里怎么看 Mermaid 渲染出来的超大图。κόσμος 调侃:“thats the neat part -- you don't”。随后有人推荐
mermaid-ascii,把 Mermaid 转成 ASCII 图,并表示“我喜欢这个。。。”。另有人提出一个奇妙想法:能否用 edit-indirect 直接弹出一个 childframe 来编辑。 - Windows 深色模式边框问题:从 emacs-devel 上的讨论延伸出来。Windows 切换系统深色/浅色主题时,Emacs 边框颜色不会跟着变。zdn 认为这个问题他不想在 Emacs 层解决,因为需要像 VSCode 一样自己重绘标题栏,非常底层;他以前搞过 ImGui,知道这种非客户区只能由软件自己重绘,而他 Windows 开发经验不多。
【专题】Markdown 编辑路线之争:markdown-ts-mode / markdown-mode / org
- 有群友尝试
markdown-ts-mode后觉得“还不太行”“差了好多能力”,在犹豫是 all in 还是暂时留在markdown-mode。 - zdn 指出
markdown-mode的准确度不行:代码注释分不清,加粗符号**一多着色就乱;准确度不行的情况下就不太想用了。 - 最后有人调侃式地给出终极方案:“all in org 🌚”。
【专题】Emacs 版本与补丁动态
- Emacs 31.1 RC1 发布。
- 有群友成功运行 Emacs 32.0.25,并准备“赶紧加各种神器 patch”;提到 canvas patch 还没研究,明天上传安卓 APK。
- org latex preview 进主线已经几个月没动静,群内关心是否仍在推进。
- org-mode mailing list 上出现一个低门槛贡献机会:Earl Chase 请求移除一行代码,但自己不再能向 FSF 转让版权,因此邀请其他感兴趣的人提交 patch。
🔑 关键概念与技术解析
- org latex preview:Org-mode 的 LaTeX 片段/公式实时预览能力,社区长期希望将其合入主线;本次讨论中提到已数月无进展。
- markdown-ts-mode:Emacs 基于 tree-sitter 的 Markdown 主模式,仍在完善中,功能覆盖和容错能力尚不如老牌
markdown-mode。 - libmpv / GStreamer / xwidget:在 Emacs 中嵌入视频播放或多媒体渲染的潜在底层方案。xwidget 是 Emacs 嵌入 GTK/WebKit 等外部组件的能力。
- pale:Codeberg 上的包(MonadicSheep/pale),本次被重新提起;结合上下文,可能与在 Emacs 中接入 GStreamer/libmpv 实现媒体播放有关。
- childframe / edit-indirect:Emacs 的 child frame 与 indirect buffer 机制,可用于弹出独立小窗编辑某个 buffer 片段。
- mermaid-ascii:将 Mermaid 图渲染为 ASCII 图的工具,避免在 Emacs 中直接查看超大位图/矢量图。
- canvas patch:聊天中提到的 Emacs “canvas” 补丁,未展开细节;推测与 Emacs 内部绘图能力有关,值得跟踪。
- Windows 自绘标题栏 / non-client area:Windows 深色模式下边框颜色不跟随的根源;通常需要应用自行绘制非客户区,类似 VSCode、ImGui 做出的方案,不能只依赖默认窗口装饰。
💎 碎片知识与金句拾遗
- “可以接 GStreamer 或者 libmpv”
- pale 包地址:https://codeberg.org/MonadicSheep/pale
- gstreamer + xwidget 老讨论:https://lists.gnu.org/r/emacs-devel/2021-11/msg01337.html
- “thats the neat part -- you don't”——关于在 Emacs 里看超大 Mermaid 图的自嘲式回答。
- mermaid-ascii 项目:https://github.com/AlexanderGrooff/mermaid-ascii
- “edit indirect这种能不能直接弹出一个childframe来编辑”
- “all in org 🌚”
- zdn 对 markdown-mode 的评价:“准确度不行”“代码注释分不清 加粗符号**一多着色就乱”“准确度不行的情况下就不是很想用了”。
M-x ysqd <RET>:群内未解释具体含义,可能是某个命令或内部梗,保留待考。- Emacs 31.1 RC1 公告:https://lists.gnu.org/archive/html/emacs-devel/2026-08/msg00599.html
- “明天上传安卓 APK”
- Windows 深色模式边框问题相关 issue:https://github.com/LionyxML/auto-dark-emacs/issues/43
- zdn 关于 Windows 标题栏:“这个不想解决 这个想解决得重绘制标题栏”“像vscode那样 自己绘制一个标题栏”“这个东西很底层”“我以前搞过imgui 研究过这东西 这个东西只能软件自己重新绘制”
- org-mode 邮件中的贡献机会:Earl Chase 写道:“Can you submit a patch that removes this line? I would submit one but I no longer can give FSF my copyright assignment.” 对 org 贡献感兴趣的人可以借此提交 patch。
🛠️ 值得深入研究的点 (Follow-up)
- pale → Emacs 视频播放:
pale目前公开信息较少,但结合 GStreamer/libmpv 和 xwidget 旧讨论,可能是把 Emacs 推向多媒体终端/演示工具的一条路线。 - Emacs canvas patch:群友明确说“还没有研究”。若与 Emacs canvas 绘图能力有关,可能显著扩展 Emacs 的图形/渲染能力。
- mermaid-ascii:对用 Emacs 做文档、流程图预览的人很实用,值得试用并整合到 org/markdown 工作流。
- Emacs 31.1 RC1 / 32.0.25 与 Android APK:跟进新版本特性,尤其是 Android 支持与 patch 生态。
- Windows 自绘标题栏与 auto-dark:此前 emacs-devel 讨论的跨平台深色接口是否已经落地,可继续关注 auto-dark issue #43。
- org latex preview 主线:已有数月无动静,关注是否有新的 patch 或维护者推动。
- org-mode patch 机会:Earl Chase 请求删除某行的 patch,属于低门槛入门贡献。
🧠 Hermes GPT-5.5 观点延伸
中心判断:今天的 markdown 之争和 GUI 边界讨论,问的是同一件事——Emacs 的力气该花在文本的语义精度上,还是花在让自己更像别的应用上。群里的本能答案出奇一致:选前者。
准确度是地板,功能列表是天花板。 zdn 弃用 markdown-mode 的理由值得记下来:不是功能少,是"代码注释分不清、加粗符号一多着色就乱"。正则 font-lock 的语义盲区修一个坏一个,而 markdown-ts-mode 虽然"差了好多能力",但着色建立在语法树上——能力缺口可以补,语义错误难修。可验证的判断:迁移决策别数 feature,拿同一份混合 fence、行内代码、多层加粗的真实文档做 A/B,直接比 font-lock 输出。
"all in org 🌚"是当天最被低估的一句话。 它其实不是玩笑,是第三条路:不修 markdown 的解析器,换一个语法所有权在 Emacs 手里的格式。org 的护城河不在功能,在所有权——单一维护者、无上游标准漂移、无双模式分裂。代价也真实:离开 Emacs 即孤岛,导出是唯一出口;FSF 版权转让甚至能卡住一行删除 patch(Earl Chase 那封邮件)。文档存活周期以年计的人,稳定性值这个价;需要频繁和外部协作的人,则相反。
GUI 边界线上,共识已经形成。 超大 mermaid 图"you don't"、mermaid-ascii 被喜欢、视频播放"挺困难"——本能答案一致:把东西变回文本,而不是扩大渲染面。文本变换可 grep 可 diff;嵌入渲染(gstreamer+xwidget,2021 年 emacs-devel 就聊过)高成本高维护,从未落地。canvas patch 是唯一反向信号,值得盯,但盯的时候先问它服务哪个文本工作流。
Windows 标题栏,zdn 拒绝在 Emacs 层解决是对的。 非客户区重绘是每个平台一份的平台债,VSCode 有公司在全职维护这件事,Emacs 核心没有。emacs-devel 的"通用深色接口"统一得了语义(该不该深色),统一不了实现(各平台标题栏怎么画)。可验证的判断:这个 bug 的落点最可能是第三方包(auto-dark 周边或独立标题栏包),押注核心修复的预期收益很低。
可继续实践: 拿一份真实 markdown 文档,对 markdown-ts-mode 和 markdown-mode 做边界 case 准确率 A/B(fence/注释/行内代码/多层加粗),一次实测就能验证当天最尖锐的判断;顺手把 mermaid-ascii 接进 org 导出流程,看"文本变换"路线对超大图的实际覆盖。
Emacs 轻聊讨论组
🎯 核心热点与专题探讨
专题一:大模型订阅与 API 生态的信任危机及性价比之争
今天群内围绕多个大模型服务展开激烈讨论,核心矛盾集中在“厂商涨价/减权益与用户信任崩塌”以及“不同订阅方案的横向性价比”。
opencode 事件定性:群友直言“opencode 这个事情告诉我们,便宜不是白捡的”。opencode 曾以“可自部署、低成本托管、价格可复现”吸引用户,随后涨价并削减额度,被斥为“耍猴”。多人表示对其“opencode2”进度失去信心,并延伸到“不会再薅国内羊毛”的普遍态度。
国内模型套餐变动:智谱成为焦点。老套餐 V1 量大、无周限,V2 Pro 被部分用户认为“能打”,但新套餐被吐槽为“变成 token plan 了,不够用”“太坑了”。有人后悔没有直接买一年老套餐,并指出“智谱赶人走的欲望太大了,新模型上线就 429,没事干就动套餐权益”。同时,群友对 Kimi 的算力来源提出质疑——“kimi 的算力都是犄角旮旯里扣出来的,智谱背靠清华所以总能够抢到卡”。
海外订阅横向对比:
- ChatGPT App 的对话量独立于网页/API 额度,这一点被多人确认“一直都这样”,且“ChatGPT Pro 比 sol max 都要好用”。
- SuperGrok 被推为“最好”,原因是“搞了 heavy 档位之后,还送 Cursor Ultra,这么算下来非常值”。代价是“100 刀”。
- GPT-5.6 Sol 在 OpenRouter 上价格下调 50%,群友推测是“周四 astra 正式发布”的前奏;但 Sol Ultra 被批评“思考质量还不如 Luna Max,派出一大堆小弟出去干活,又没能力收敛”。
- 对 Anthropic 的评价是:“在问题深入的理解上,还是比 Fable 5 差一些。但 Anthropic 也就 Fable 5 堪用。”
专题二:本地大模型部署与 vLLM 调优实战
群内有成员在部署 Qwen 系列模型并调优 vLLM,过程暴露出网络、代理与推理性能问题。
网络与代理:部署 vLLM 时遇到严重网络问题,代理“两种协议都断流”,换 VPS 无效,最后换 NaiveProxy “貌似不断了”,但第二天又“一下好一下坏”。下载大模型时,“modelscope 好啊,直接跑满千兆”,并有人考虑“以后下大文件要在 vps 上下然后 rsync 了”。
性能与参数:Qwen3-8-27B 的跑分被称“有点逆天”,但“和 kimi 一个毛病——思考过度”。实测 fp8、262k ctx、未开 MTP 时 26t/s,开启 MTP2 后“快了一丢丢”。关键问题出现在长上下文并发:“kv cache 不够用了,然后就会把所有会话都拖慢”。另有“这些大模型可以使用多块 GPU 来跑”的经验。
vLLM 现状:群友给出结论——“vllm 确实得调参啊”“bug 还是太多,优化也还不够”,并引用 vLLM issue #47602 作为例证。
专题三:Emacs 生态在 Windows 下的暗坑与踩坑记录
今天有两条与 Emacs 相关的深度讨论:一个是向 MELPA 提 PR,另一个是 Windows 下编译 Telega 的排错过程,后者技术细节很硬核。
Telega 编译问题:用户在 msys2 环境编译 telega-server 时遇到
SIGHUPundeclared、sys/wait.h找不到等错误。根因被定位为“头文件冲突”——“mingw64 的头文件把 msys2 的头文件覆盖了”,因为 Makefile 中LIBS_PREFIX指向/mingw64,导致 gcc 找头文件时跳到 mingw 目录。解决方法是:把 tdlib 安装到独立目录(如/d/local),编译 telega-server 时指定该目录,避免冲突。调试方法论:提供帮助的群友强调“看到报错自己读一下,看一下构建脚本,看一下编译命令就能知道为什么报错”,并分享了实用技巧:“你下次看到是 makefile 脚本的,
make -n会把构建的命令行给你但不会真的构建,你自己去分析一下就能知道为什么报错了。”其他 Emacs 相关:有人向 MELPA 提了
mininbuffer-frame的 PR 尚未被处理;Windows 上 Emacs 的term适配很差;新项目emacs-reddigg让 Emacs 可以直接浏览 Reddit;Telega 在 Windows 下曾出现无法加载消息列表、进入频道空白的问题。
专题四:浏览器与 Mozilla 的信任危机
Firefox 内置广告拦截功能成为争议点:该功能“不会屏蔽谷歌等搜索引擎广告和火狐自身投放的广告”。群内批评声浪较高:
- “这样当了婊子还要立牌坊的感觉真别扭”“赚钱不寒碜,但是这样赚钱很别扭”。
- 更广泛的批评指向 Mozilla 的经营:“mozilla 这几年就是这个鬼样子,不停的把钱挥霍在管理层,以及这帮蠢材觉得有利可图的领域”“之前搞的开源的 asr,搞了这么几年,一点屁成果没有”“最关键它的训练数据集是免费征集的,然后自己精筛一遍过后就开始卖收费数据集”。
- 也有人认为“市面上 adb 和 adg 好用的一堆,还可以做到按元素屏蔽,凭啥要用它的试验品”。
🔑 关键概念与技术解析
- opencode:一个曾以“可自部署、低成本托管”为卖点的 AI 编程/托管服务,近期因涨价、削减额度及宣传与事实不符而引发用户信任危机。
- vLLM:高性能大语言模型推理引擎,常用于本地部署 LLM,支持 PagedAttention、连续批处理等优化,但仍需针对 KV Cache、并行策略等调参。
- KV Cache:Transformer 推理时的键值缓存,用于避免重复计算历史 token。长上下文或高并发时 KV Cache 耗尽会导致所有会话速度拖慢。
- fp8:8 位浮点数格式,用于模型量化推理,可在保持可接受精度的同时提升吞吐、降低显存占用。
- MTP / MPT:消息中提到的可能是 multi-token prediction / speculative decoding 相关参数,开启后能小幅提升生成速度(群友实测“快了一丢丢”)。
- tdlib / Telega:tdlib 是 Telegram 的官方 C++ 库;Telega 是 Emacs 的 Telegram 客户端,需要编译 telega-server 与 tdlib 配合。
- msys2 / mingw64 头文件冲突:在 Windows 下同时使用 msys2 与 mingw64 工具链时,若 Makefile 的 include/lib 路径配置不当,会导致头文件被错误覆盖,出现
SIGHUP、sys/wait.h等 POSIX 兼容性错误。 - NaiveProxy:一种抗审查代理协议,基于 Chromium 的网络栈,伪装性强。群友换用后暂时缓解了断流问题。
- ModelScope:阿里推出的模型托管平台,国内下载 HuggingFace 模型时常作为替代,带宽表现较好。
- SuperGrok heavy 档位:xAI 的高阶订阅档位,附带更重的推理模式,并捆绑赠送 Cursor Ultra 权益。
- GPT-5.6 Sol / OpenRouter:GPT-5.6 Sol 是 OpenAI 模型在 OpenRouter 上的一个版本,近期价格下调 50%;OpenRouter 是聚合多家模型 API 的平台。
- MCP / local-mcp:MCP(Model Context Protocol)是连接 AI 助手与外部工具/数据源的协议;
nakasyou/local-mcp是一个本地 MCP 工具,可将本地能力接入支持 MCP 的客户端。 - Nix vs Homebrew:macOS 上两种包管理方案,群内结论是 Nix 目前不能完全取代 Homebrew。
- Zen Browser:基于 Firefox 的注重隐私与定制性的浏览器,但近期被反映 bug 较多。
- emacs-reddigg:一个 Emacs 插件,允许在 Emacs 内浏览 Reddit。
💎 碎片知识与金句拾遗
- “便宜不是白捡的,所以我不会再薅国内羊毛了。” —— 对低价陷阱的清醒总结。
- “opencode 还信誓旦旦说自己在托管,还能够复现出来价格呢,结果一下就被打回原形了。”
- “kimi 的算力都是犄角旮旯里扣出来的,智谱背靠清华所以总能够抢到卡。”
- “智谱赶人走的欲望太大了,新模型上线就 429,没事干就动套餐权益。”
- “ChatGPT app 的对话不算入用量,独立量,一直都这样。” —— 被多人确认的省钱细节。
- “ChatGPT Pro 比 sol max 都要好用。”
- “supergrok 应该是最好的,搞了 heavy 档位之后,还送 cursor ultra,这么算下来非常值。”
- “与其抄别人垃圾的 skills,不如一句朴实无华的:'用你的多模态 review 给我重写 PPT'。”
- “好的 skill 很多都练进去强化过了,加了反而变差。” —— 提醒避免过度依赖低质量 skill。
- “kv cache 不够用了,然后就会把所有会话都拖慢。” —— vLLM 调优的实践教训。
- “modelscope 好啊,直接跑满千兆。”
- “这些大模型可以使用多块 GPU 来跑。”
- “所谓的高端,不就是「我和别人不一样」么?” —— 从法拉利手动挡延伸出的消费洞察。
- “等电车在欧美普及了,手动挡就具有奢侈品属性了。” —— 关于收藏品价值的预测。
- “你下次看到是 makefile 脚本的,
make -n会把构建的命令行给你但不会真的构建。” —— 编译调试小技巧。 - “这个傻鸟问题,起因是我在编译 tdlib 期间,重启了 Windows explorer 文件管理器就成这样了,重启电脑就好了。” —— 一个玄学但真实的坑。
- “ai 来了以后,动脑子的机会就少了,很少会脑子里面跑代码和想代码了。” —— 对 AI 依赖的反思。
- 关于 Firefox 广告拦截:“这样当了婊子还要立牌坊的感觉真别扭。”
- “mozilla 这几年就是这个鬼样子,不停的把钱挥霍在管理层,以及这帮蠢材觉得有利可图的领域。”
🛠️ 值得深入研究的点 (Follow-up)
- Cursor Origin Code Hosting(cursor.com/changelog/origin-code-hosting):Cursor 向代码托管/源集成方向演进,群友此前已预测此趋势,值得跟踪其对 AI IDE 与代码托管市场的影响。
- vLLM issue #47602(github.com/vllm-project/vllm/issues/47602):涉及 vLLM 的 bug 或调优案例,对本地部署调参有参考价值。
- nakasyou/local-mcp(github.com/nakasyou/local-mcp):本地 MCP 工具,可将本地脚本/能力接入 MCP 客户端,适合构建个人 agent 工作流。
- emacs-reddigg(github.com/thanhvg/emacs-reddigg):在 Emacs 内浏览 Reddit 的项目,拓展 Emacs 作为信息终端的可能性。
- GPT-5.6 Sol 降价与 Astra 发布:OpenRouter 上 GPT-5.6 Sol 价格下调 50%,群友推测 Astra 将于周四正式发布,建议关注后续模型阵容与定价策略。
- SuperGrok heavy + Cursor Ultra 捆绑:该组合被群友认为极具性价比,若关注 AI 订阅可深入研究其权益细则。
- NaiveProxy 断流与 VPS+rsync 大文件下载方案:在代理不稳定环境下,群友提出“VPS 下载大文件后 rsync 到本地”的备选思路,适合大模型权重下载场景。
- Windows 下编译 telega-server 的头文件冲突解决法:将 tdlib 安装至独立目录(如
/d/local)并指定LIBS_PREFIX,避免 mingw64 与 msys2 头文件冲突,该方案对 Emacs 用户在 Windows 上编译类似 C/C++ 扩展有通用参考价值。
┊ review diff a//tmp/opinion_ext.md → b//tmp/opinion_ext.md @@ -1,11 +1,11 @@
🧠 Hermes GPT-5.5 观点延伸
-中心判断:今天吵 Org 的各派——org-gtd 派、Fantastical 派、自研 App 派、Telegram 后端派、弃 Org 转 logseq 派——吵的都不是"Org 行不行",而是"自由系统的成本谁来付"。Org 的自由不是免费的:它把方法论设计、触发机制、移动端体验三笔账全部转嫁给了使用者。每一派都在付账,只是付的地方不同。 +中心判断:“便宜不是白捡的”只说了一半。当天真正的主线是“复现”:opencode 被锤、智谱被骂、vLLM 要调参、skill 要 A/B,串起来是一句话——不能在你手里复现的东西,价格、能力、基准,都会以别的方式被重新定价。
-一、外化记忆的前提不是存储,是触发器。 "记纸上反而忘得快"和"记下来才能释放大脑空间"看起来互斥,其实各对一半:前者描述的是没有触发器的存储,后者默认了触发器存在。群里的 inbox 就是前者的下场——"想起来就整理,想不起来拉到,反正记下来了"。大家集体把 SCHEDULED 当"为了让他出现在 agenda 中"的开关用,而不是当日期用,说明触发器需求一直在被本能地补。可以立一条可验证的判断:一条 capture 若没有任何触发机制(agenda 过滤、提醒、review 清单),它被再次阅读的概率趋近于零,跟没记差不了多少。 +一、订阅按“权益稳定性”计价,不按单价。 opencode 被打回原形的不是涨价,是“可自部署、价格可复现”这个承诺本身;智谱老 V1 被怀念也不是因为便宜,是量大且没有周限——确定性就是钱。反向例证当天就有:Sol 降 50%,群里直接读出“周四 Astra 要发了”——降价是供给信号,不是让利。判断就一条:关键路径只绑 API 或自部署;订阅墙里的权益一律按“随时会变”入账;看到降价先问厂商在清什么,而不是抢着薅。
-二、冻结的配置是方法论成熟的信号。 那位 TODO 关键字"用了几年暂时没变化过"的群友,配置已经从他"实践 GTD 的工具"长成了"GTD 本身"。"org 里面太自由了,要人为地用自己的方法论框起来,然后遵守这套方法论"——这句话的终点就是停手不改配置。工具探索期结束的标志不是装了什么新包,而是停用;反过来,配置 churn 率高的系统,多半是方法论还没定型。 +二、模型能力看收敛,不看派活。 “Sol Ultra 派出一大堆小弟出去干活,又没能力收敛”,和“好的 skill 很多都练进去强化过了,加了反而变差”,说的是同一件事:并行和功能数量是过程,收敛才是结果。可验证的标准只有一条——同一任务下,多 agent/skill 方案和单模型裸指令比结果方差,方差没降的方案就是噪音。给每个子任务配独立验收物,并留一个明确的收敛人;没有验收物的派活,等于没有测试的提交。
-三、移动端之争的真实瓶颈是视图层,不是格式。 org 是纯文本,git、beorg 都能同步,格式从来不是硬障碍。自研 App 要复刻的是 Fantastical 日历视图、Things 列表视图加 journal——他重写的不是解析器,是 agenda 这个视图,只是换了个宿主。Telegram 后端方案的成立点也在这里:Telegram 免费提供的是多端视图加定时提醒的基础设施,org 负责数据。"封号了就什么都没了"则点出了正确架构:本地为源,远端为镜像。镜像可以毁,源头不能丢,这条对任何云同步方案都成立。 +三、单人基准不能上线。 26t/s 是 fp8 单人长上下文的成绩,“kv cache 不够用了,然后所有会话拖慢”才是并发的真相——单请求测出来的性能复现不到生产。vLLM 的“确实得调参”、issue #47602,本质都是这句话。上线前的基准只认一种:并发长上下文下的会话间劣化曲线,按最坏情况留余量,而不是按最优吞吐报数。
-可继续研究/实践:给 capture 模板加一个必填触发字段(SCHEDULED 或 agenda 过滤器),跑一周,统计无触发条目的 review 率,再和历史 inbox 堆积率对比。如果差异显著,那评估任何任务管理工具的第一指标就不该是"录入多快",而是"它能不能在你该想起的时候主动出现"。 +可继续研究/实践: 这周把“复现”做成三件小作业:高频模型调用做一次供应商冷切换演习,实测切换成本;挑一个最常用的 skill 和裸指令跑 A/B;本地推理服务测一组并发长上下文的拖慢曲线。三个数字拿到之前,先别信任何“超值、逆天、好用”。顺带记下当天群友给的方法论:让工具把证据复现给你看(make -n 打出构建命令),而不是替你猜。 已完成。观点延伸板块已生成并保存到 /tmp/opinion_ext.md(正文约 613 个中文字,符合 500–1000 要求),二级标题正确。以下是要追加到日报的板块:
🧠 Hermes GPT-5.5 观点延伸
中心判断:“便宜不是白捡的”只说了一半。当天真正的主线是“复现”:opencode 被锤、智谱被骂、vLLM 要调参、skill 要 A/B,串起来是一句话——不能在你手里复现的东西,价格、能力、基准,都会以别的方式被重新定价。
一、订阅按“权益稳定性”计价,不按单价。 opencode 被打回原形的不是涨价,是“可自部署、价格可复现”这个承诺本身;智谱老 V1 被怀念也不是因为便宜,是量大且没有周限——确定性就是钱。反向例证当天就有:Sol 降 50%,群里直接读出“周四 Astra 要发了”——降价是供给信号,不是让利。判断就一条:关键路径只绑 API 或自部署;订阅墙里的权益一律按“随时会变”入账;看到降价先问厂商在清什么,而不是抢着薅。
二、模型能力看收敛,不看派活。 “Sol Ultra 派出一大堆小弟出去干活,又没能力收敛”,和“好的 skill 很多都练进去强化过了,加了反而变差”,说的是同一件事:并行和功能数量是过程,收敛才是结果。可验证的标准只有一条——同一任务下,多 agent/skill 方案和单模型裸指令比结果方差,方差没降的方案就是噪音。给每个子任务配独立验收物,并留一个明确的收敛人;没有验收物的派活,等于没有测试的提交。
三、单人基准不能上线。 26t/s 是 fp8 单人长上下文的成绩,“kv cache 不够用了,然后所有会话拖慢”才是并发的真相——单请求测出来的性能复现不到生产。vLLM 的“确实得调参”、issue #47602,本质都是这句话。上线前的基准只认一种:并发长上下文下的会话间劣化曲线,按最坏情况留余量,而不是按最优吞吐报数。
可继续研究/实践: 这周把“复现”做成三件小作业:高频模型调用做一次供应商冷切换演习,实测切换成本;挑一个最常用的 skill 和裸指令跑 A/B;本地推理服务测一组并发长上下文的拖慢曲线。三个数字拿到之前,先别信任何“超值、逆天、好用”。顺带记下当天群友给的方法论:让工具把证据复现给你看(make -n 打出构建命令),而不是替你猜。
约束全部满足:无“作为 AI”废话,所有延伸锚定原始聊天已出现的事实(opencode 自部署承诺被打破、智谱 V1 无周限、Sol 降 50% 关联 Astra、Sol Ultra 无法收敛、“skill 练进去反而变差”、26t/s 单人成绩与 kv cache 并发拖慢、make -n 调试法),中心判断→三点展开→可实践方向结构完整,未提及任何私有群 ID/session/token/脚本路径。
