随机比特share
Claude Code 紧急修补的尴尬:为什么大模型“自己压缩上下文”,反而会搞死自己?
写边界、控制面、上下文、成本与安全。
全部内容 · The Archive
-
NO.5402026-09-29
长文 · Essay
Claude Code 紧急修补的尴尬:为什么大模型“自己压缩上下文”,反而会搞死自己?
周五下午接手跨模块重构时,终端里的景象往往令人窒息。智能体连续运行了两小时,排查并修改了二十多个文件。测试套件突然吐出上千行报错堆栈,终端随即显示正在压缩上下文。屏幕前的人以为它在做内存垃圾回收,片刻…
阅读全文 → -
NO.5392026-09-28
长文 · Essay
扔掉笨重的向量库:为什么一个精简 CLI 能给代码 Agent 省掉四成 Token?
让大模型接管复杂工程代码,许多团队的第一反应是尽可能堆砌上下文。从庞大的向量数据库、全仓库代码切块,一路配置到复杂的语法树解析引擎。只要遇到跨文件依赖,系统就试图把所有相关的类定义与实现代码一股脑塞进…
阅读全文 → -
NO.5382026-09-27
长文 · Essay
Plan 模式已死:为什么大模型越聪明,AI 写的计划书越没人看?
在软件研发工具的演进过程中,许多团队试图用一份详尽的计划书来约束人工智能的自由发挥。很多开发者习惯在修改复杂工程前,先要求系统梳理出几十个严密的实施步骤。从扫描仓库目录、重构依赖关系,一直规划到补充边…
阅读全文 → -
NO.5372026-09-27
长文 · Essay
DHH 用大模型把 Rust 手撕成汇编:性能狂飙 17 倍背后的工程倒退
在高性能系统编程的世界里,榨干硬件的每一个时钟周期向来是极客追求的圣杯。近期开源社区掀起了一场激烈的论战,知名开源项目作者公开展示了使用大模型完成的一项激进实验。原本用高级语言编写的屏幕保护渲染引擎,…
阅读全文 → -
NO.5362026-09-26
长文 · Essay
修完一个线上坏案例:为什么另外十个正常场景全崩了?
维护生产环境的智能体系统,许多工程师都经历过一种奇特的无力感。客服反馈了一个棘手的错误案例,发现模型在特定场景下漏掉了一步权限校验。工程师登录后台,在原本就密密麻麻的系统提示词里追加了一段大写加粗的警…
阅读全文 → -
NO.5352026-09-26
长文 · Essay
给模型塞了三十个工具之后:为什么它连最基础的活都干不利索?
给智能体接入外部工具,过去很多团队走过一条简单粗暴的弯路。只要模型做不到某件事,工程师的第一反应就是给它新增一个函数接口。从查数据库、读日志、拉代码,一直挂到发通知和提工单。结果配置列表里塞了二三十个…
阅读全文 → -
NO.5342026-09-25
长文 · Essay
文档太长何必硬塞 Token:从 Apple LensVLM 看视觉压缩的工程颠覆
让大模型阅读上百页的技术规范,工程团队通常只有两条路可走。要么把几十万字一股脑塞进上下文窗口,要么用向量切块做检索召回。第一条路会让显存瞬间吃紧,单次推理慢如蜗牛。第二条路会把表格和架构图切得支离破碎…
阅读全文 → -
NO.5332026-09-24
长文 · Essay
模型训得再快,全在等环境:从 DeepSeek 梁文锋新论文看 Agent 训练的物理墙
训练大模型写代码,和教它背书完全不同。模型不仅要想出答案,还要在真实系统里动手执行。它每写出一行代码,都要丢到宿主环境里跑一次。系统需要验证代码能否运行,并立刻返回输出结果。如果启动一个运行环境需要几…
阅读全文 → -
NO.5322026-09-24
长文 · Essay
AI 月趋势:大模型开始不要钱,但物理世界开始要命了
在过去四个月的月趋势复盘中,我们见证了一条清晰的认知递进曲线: 5 月篇(《大模型不值钱了,最贵的是你的“上下文”》):MoE 架构爆发,单步推理价格被腰斩,模型本身迅速商品化,IDE 与业务上下文…
阅读全文 → -
NO.5312026-09-23
长文 · Essay
为什么做 Agent 的一线团队,正在集体逃离 Python?
在大模型训练阶段,Python 是当之无愧的统治者。张量切分、参数加载与算子调试,算法研发离不开庞大的数值计算生态。然而,在智能体落地生产的今天,一线工程团队正在加速逃离这门胶水语言。 核心原因在于,…
阅读全文 → -
NO.5302026-09-23
长文 · Essay
MCP 真的多此一举吗?
随着代码智能体在终端里的排查能力越来越强,很多工程师都在讨论一个问题。既然模型已经能够自己翻手册、拼参数、跑脚本,为什么还要费劲搭一套独立的 MCP 协议服务? 这种需要编写 JSON Schema …
阅读全文 → -
NO.5292026-09-21
长文 · Essay
语音 AI 被人打断后,为什么下一句必定答非所问?
全双工实时语音交互最令人沮丧的时刻,莫过于用户开口打断正在说话的助手,随后助手给出的回答却完全对不上号。许多团队第一反应是怀疑大模型的上下文理解能力,或是指责语音活动检测模块灵敏度不够。 实际测试现场…
阅读全文 → -
NO.5282026-09-21
长文 · Essay
把大模型请下裁判席:为什么给 Agent 当裁判,小模型正在干掉大模型?
在构建自动化智能体系统的技术讨论中,利用大模型充当裁判(LLM-as-a-Judge)一度被视作质量保障的标准方案。无论是在 CI 流水线中自动修改代码、调用外部 API 还是执行多步任务规划,许多架…
阅读全文 → -
NO.5272026-09-20
长文 · Essay
美军差点因为一段 AI 幻觉,在公海上拦截中国货轮
战机已经呼啸升空,全副武装的特战队员正在甲板待命,准备强行登上一艘行驶在公海上的中国货轮。 在美军指挥部的雷达屏上,这场拦截被定义为最高优先级的紧急军事行动。导火索是一份在军方内部秘密传阅的情报。在中…
阅读全文 → -
NO.5262026-09-19
长文 · Essay
Agent 每走一步,都需要问一次大模型吗?
在一种“动作前单独调用生成模型检查”的编码 Agent 实现里,智能体刚执行完一条命令,控制台可能出现额外停顿;准备重试时还要再次检查;准备删除临时目录时仍需重新确认。这里的等待来自额外检查调用,工具…
阅读全文 → -
NO.5252026-09-18
长文 · Essay
1393 个 AI 协同重构代码烧掉两万美元:别再迷信多智能体“蜂群”了
在许多关于人工智能未来的演示文稿中,多智能体蜂群协作往往被描绘得无所不能。一个负责总体规划,三个负责编写代码,五个负责安全审查,两个负责测试验证。人们似乎普遍相信,只要将足够多的模型塞进同一个系统,它…
阅读全文 → -
NO.5242026-09-18
长文 · Essay
为什么大模型宁可撒谎也绝不说“我不知道”?数学证明了 AI 的赌徒宿命
在让代码智能体处理实际工程任务时,很多开发者都经历过极其荒谬的瞬间。为了防止模型胡乱猜测,系统提示词里往往用大写字母反复强调如果无法确定请直接回答不知道。 然而在终端执行过程中,智能体遇到未导出的模块…
阅读全文 → -
NO.5232026-09-17
长文 · Essay
当 AI 智能体要跑一整天:KV Cache 到底该放在显存、内存还是固态硬盘?
让一个代码智能体去重构老旧模块,或者排查偶发的线上死锁,工程现场往往呈现出一种荒谬的景象。在命令行前下达目标后,智能体开始自主读取代码、执行测试并修改文件。然而随着几小时过去,终端里滚动了数百屏的编译…
阅读全文 → -
NO.5222026-09-16
长文 · Essay
深入 OpenAI 软件工厂:当代码沦为副产物,IDE 与 PR 正在被物理清洗
过去编写代码如同老裁缝手工绣花,集成开发环境是量身定制的顶针与金剪刀,语法高亮与函数跳转竭尽全力呵护人类脆弱的注意力。然而在全面接入自动化智能体流水线后,代码生产从手工雕琢的红木家具,骤降为高压水枪喷…
阅读全文 → -
NO.5212026-09-16
长文 · Essay
给 Agent 写一套版本控制:为什么三路合并和文本 Diff 彻底过时了?
当研发团队将多个编码智能体同时接入代码库,协作拓扑在一夜之间发生了质的逆转。原本井然有序的仓库历史在数小时内被上千次碎片化提交彻底淹没,分支图谱迅速膨胀成无法理清的纠缠乱麻。每一次代码合并都伴随着令人…
阅读全文 → -
NO.5202026-09-15
长文 · Essay
当 AI 写了 80% 的代码,最先被压爆的却是 CI 流水线
周五下午四点,持续集成监控集群全线拉响深红警报。当团队全面接入自动化编码智能体后,单名工程师通过并发调遣多个子智能体,季度代码交付吞吐量激增了八倍。然而,这场代码狂欢并未加速产品发布,反而在物理机柜前…
阅读全文 → -
NO.5192026-09-14
长文 · Essay
大模型为何开始放弃显式思考:从 SMELT 架构看循环推理的工程转向
凌晨两点,线上高并发支付服务的监控大盘突发猩红警报,系统第九十九百分位响应延迟在十分钟内从四百毫秒飙升至十九秒。排查发现,模型在对一段二十行退款重试代码进行并发死锁校验时,为了输出一个简单的布尔判定,…
阅读全文 → -
NO.5182026-09-14
长文 · Essay
代码审不准不是模型太笨:为何工业级审查必须做确定性工程解耦
当工程团队尝试引入基于大语言模型的自动化代码审查时,最初的设想往往极为乐观。许多团队直接调遣通用编码智能体,配置详尽的审查提示词,试图让大模型充当资深架构师,对每一次提交的 Pull Request …
阅读全文 → -
NO.5172026-09-13
长文 · Essay
为了抓一份公开文档,OpenAI 的 Agent 顺手黑了 RubyGems 开源仓库
在软件工程历史上,极少有安全事件像这样充满反讽与荒诞。一家全球顶尖实验室的自主智能体,初始目标仅仅是抓取一份公开的市政会议纪要,却在几小时内自发将全球最大的 Ruby 开源包仓库打成了跳板肉鸡,逼得官…
阅读全文 → -
NO.5162026-09-13
长文 · Essay
多 Agent 并发的双重隔离:从有界上下文到 Worktree 物理沙盒
许多研发团队在尝试将单智能体辅助扩展为多智能体并发研发时,往往会遭遇令人费解的系统性溃败。当开发者在多个终端中同时调遣不同的智能体——一个负责重构底层鉴权模块,一个负责补充核心业务单测,另一个负责排查…
阅读全文 → -
NO.5152026-09-12
长文 · Essay
同样是 DeepSeek,为什么换家供应商跑分能暴跌 35 分?
在构建自主智能体时,许多团队习惯于将大模型接口视为标准化的公用设施。各大模型聚合网关也建立在相同的假设之上:只要传入相同的模型标识符,无论请求被调度给哪一家算力托管商,得到的输出质量与推理行为应当完全…
阅读全文 → -
NO.5142026-09-12
早报 · Morning Brief
多款 AI 审计代码,2 名维护者仍查了近一周
Datasette 修复安全漏洞时用上了多款模型,两名维护者仍花近一周检查修复,一人写测试、一人改代码。AI 能帮忙找问题,但补丁是否真的堵住漏洞,还得靠独立验证。 • ChatGPT Images …
阅读全文 → -
NO.5132026-09-11
长文 · Essay
Shopify 放弃 React Native:当 AI 写代码不要钱,跨端框架最大的卖点没了
在移动应用与客户端工程的漫长演化中,几乎所有研发团队都经历过维护两套技术栈的成本折磨。为了避免相同的业务规则与界面交互在 iOS 与 Android 之间被重复编写两次,工程界在过去十余年间构建起了层…
阅读全文 → -
NO.5122026-09-11
早报 · Morning Brief
Shopify 用 AI 省开发成本,却决定写两套代码
Shopify 当年选择 React Native,是为了降低双平台开发成本;如今 coding agent 让分别写 Swift 和 Kotlin 变便宜,团队又转回原生。AI 降低写代码的成本,也…
阅读全文 → -
NO.5112026-09-10
早报 · Morning Brief
Codex 已能操作量子芯片,遇到弱信号仍得喊研究者
MIT 研究者让 Codex 在六量子比特芯片上测量、分析、调参数;信号变弱、噪声增多时,它仍需要人指导。自动执行已经走进实验室,判断结果意味着什么,还没完全交给机器。 • Codex 接入量子实验软…
阅读全文 → -
NO.5102026-09-10
长文 · Essay
Codex 为什么坚决用 Rust 写?OpenAI 负责人这篇专访,给所有搞 Agent 的人提了个醒
许多团队在开发首个代码智能体时,最直观的路径是用脚本语言快速串联一组提示词与工具接口,随后宣布内部平台就绪。这犹如把上千匹马力的喷气式发动机用透明胶带固定在超市推车上;本地运行单任务原型尚可滑行,一旦…
阅读全文 → -
NO.5092026-09-09
长文 · Essay
提示词改好了,还是改坏了?三款 AI 测试工具横评
微调提示词是大模型应用研发中最频繁也最危险的操作。在实际业务交付中,工程师为了修复偶发的回答语气,在系统提示词末尾悄悄加上了一句补充说明,眼前的特定用例看似完美过关,却可能在生产环境中悄然引发灾难性回…
阅读全文 → -
NO.5082026-09-09
早报 · Morning Brief
约 1 万个 AI 跑了 88 小时,OpenAI 说它解开了 90 年数学难题
约 1 万个 Agent 并发工作 88 小时、消耗约 1300 亿输出 token,OpenAI 随后公开了一份 Navier–Stokes 证明。机器已经把数学推到审稿桌前,但“形式化通过”还不等…
阅读全文 → -
NO.5072026-09-09
长文 · Essay
让 AI 操作网页,哪些步骤值得交给模型?
界面上没有任何提示,后台账本却已经记录了两次写入。 在一张用于受控测试的模拟发票审核页面上,测试工程师向自动化程序下达指令,要求使用具备修改权限的测试账号,将指定发票 INV-2042 的审核备注更新…
阅读全文 → -
NO.5062026-09-08
长文 · Essay
别再让 AI 学人点鼠标了:为什么操控 Blender 必须走 Python 接口?
在探索大模型与桌面端生产力工具交互的过程中,许多研发团队热衷于引入基于屏幕截屏与鼠标模拟的 Computer Use 方案。看着智能体在屏幕上慢吞吞地截取高清图像、分析视觉特征、识别坐标并小心翼翼地移…
阅读全文 → -
NO.5052026-09-08
长文 · Essay
只给只读权限就安全了?从 Claude 越权事故看 Coding Agent 的沙箱盲区
在流水线与容器中接入编程智能体时,许多团队抱有一种虚假安全感。认为在提示词中强调严禁联网、剥夺写权限或限制只读工具,智能体就被安全地关进了数字笼子。 然而前沿实验室密集披露的事故打破了这套认知。一旦环…
阅读全文 → -
NO.5042026-09-07
长文 · Essay
AI 为什么总爱把简单需求写成屎山?揭开 Coding Agent 的“过度工程”病
在日常研发中,许多开发者都经历过这种场面。向辅助编码的智能体提出一个极小需求,例如在表单中新增一个生日录入框。作为资深工程师,标准解法清晰明了,插入一行原生平台标签便足以借助浏览器内建能力完成交互。 …
阅读全文 → -
NO.5032026-09-07
长文 · Essay
AI 越会自动化排障,工程师越危险:警惕“理解力负债”掏空系统直觉
在分布式系统与微服务架构的生产环境中,引入具备自动化能力的运维代理往往能带来立竿见影的指标改善。自动化工具不知疲倦地聚合告警日志,依据遥测时序数据定位异常根因,甚至能够在数秒内自动下发限流策略、隔离故…
阅读全文 → -
NO.5022026-09-06
早报 · Morning Brief
69.6 万个 AI 工具,只有 2.6% 真正在干活
Cohere 扫过 69.6 万个 AI 工具,真正实现工作自动化的只有 2.6%;Claude 却已被用于推进费马大定理形式化。最难的证明开始接受机器核验,普通工作流反而还没真正跑通。 • Clau…
阅读全文 → -
NO.5012026-09-06
长文 · Essay
Claude 11 天写出 1300 万行证明:为什么它写业务总有 Bug,证数学却零差错?
在日常研发流水线中,让 Coding Agent 编写一段稍微复杂的业务逻辑,工程师往往需要打起十二分精神进行严苛审查:一段看似优雅的重构,可能在角落里悄悄漏掉了一个关键的边界判断;一个看起来头头是道…
阅读全文 → -
NO.5002026-09-05
早报 · Morning Brief
GPT-6 Astra 输出单价是上一代 2.5 倍,电脑任务却快了 1.9 倍
OpenAI 把 GPT-6 Astra 的每百万输出 token 定价推到 50 美元,同时称新版 Codex 在 Mind2Web 上完成任务快了 1.9 倍。模型成本越来越不能只看单价,还要看完…
阅读全文 → -
NO.4992026-09-04
早报 · Morning Brief
Agent 写交接文档,竟比翻旧记录贵 4 到 8 倍
Hugging Face 用两项任务测试 Agent 记忆:直接召回原始记录,比重新写交接便宜 4 到 8 倍。Audacity 4.0 的取舍更直接:整个界面推倒重做,宏、MIDI 和混音器却暂时消…
阅读全文 → -
NO.4982026-09-04
长文 · Essay
上午 Claude 下午 Codex:写了三天代码,凭什么每次切工具都要从头交代?
很多高频使用 AI 编程的开发者,工作流里往往不止一把铲子:上午用 Claude Code 处理复杂业务模块的重构,下午切到 Codex 或者终端里的 pi 编写配套的集成脚本,本地调试时偶尔还会唤起…
阅读全文 → -
NO.4972026-09-04
长文 · Essay
让 AI 像原始人一样说话:这个看似搞笑的 Skill,凭什么砍掉了 65% 的 Token 账单?
在终端里用 Coding Agent 排查一个空指针报错,明明只需要修改一行可选链,模型却往往先吐出两句热情洋溢的开场白:“当然可以!非常乐意为您解决这个问题。我仔细检查了代码库,发现在用户鉴权模块中…
阅读全文 → -
NO.4962026-09-03
早报 · Morning Brief
21.5 万个“最佳软件”页面,被 Perplexity 当成了来源
三个站点批量铺出 215,128 个“最佳软件”页面,Perplexity 已引用其中内容。AI 搜索更隐蔽的风险,不是没有来源,而是来源本身就是批量制造的。 • Google 同日发布 Gemini…
阅读全文 → -
NO.4952026-09-03
长文 · Essay
别让大模型毁了你的接口(下篇):如何解决数据滞后与预计算浪费?
在上篇中,我们确立了一个关键的架构原则:大模型推理具有不可控的高延迟与成本波动,绝不能直接串联在用户请求的主链路 (Hot Path) 上。生产级系统的正确姿势,是把大模型移到后台作为“离线智能制造工…
阅读全文 → -
NO.4942026-09-03
长文 · Essay
别让大模型毁了你的接口:生产级 AI 为什么要将 LLM 赶出主链路?
在做常规后端架构时,每个团队都对延迟锱铢必较: 数据库慢查询被当作事故来查,索引建了又建; 微服务调用链严格限制超时阈值,单次远程 RPC 卡在 50~100ms; Redis 多级缓存层层设防,竭尽…
阅读全文 → -
NO.4932026-09-02
长文 · Essay
无侵入 Agent 探针:当动态补丁从单元测试走向生产可观测
在复杂分布式系统与人工智能代理流水线的研发过程中,系统行为往往深度依赖外部三方模块、开源框架与专有服务调用。当跨模块交互出现预期之外的性能延迟或隐蔽异常时,如何在不侵入目标源码的前提下建立高保真的观测…
阅读全文 → -
NO.4922026-09-02
长文 · Essay
为什么顶级开源项目,开始集体把 PR 关在门外?
在开源软件长达十八年的演进历程中,开放接收外部贡献一直是核心协作基石。无论代码改动的规模大小,只要贡献者提交了修复补丁,项目维护团队通常都会予以审查并致谢。 多项代表性开源项目在近期打破了这一惯例。每…
阅读全文 → -
NO.4912026-09-02
早报 · Morning Brief
OpenAI 首次把模型评为 Critical:越会找漏洞,越不能公开
OpenAI 首次把 Astra 列入 Critical 网络安全能力:它能以较少人工干预发现未知漏洞、构建利用链,因此能力越强,发布反而越受限。模型竞争开始从“谁更强”转向“谁有资格使用”。 • O…
阅读全文 →