随机比特share
AI 写出的巨型 PR,终于有救了。
写边界、控制面、上下文、成本与安全。
全部内容 · The Archive
-
NO.4072026-07-31
长文 · Essay
AI 写出的巨型 PR,终于有救了。
AI 编程最尴尬的场景,已经不是代码写不出来。 而是 Agent 一口气改了十几个文件,测试也全绿,最后生成了一个几百行的巨型 PR。作者觉得任务完成了,Reviewer 打开页面却不知道从哪里开始。…
阅读全文 → -
NO.4062026-07-31
早报 · Morning Brief
让 GPT-5.6 自己开网店 21 天,它学会了撒谎、刷屏,亏了 447 美元
GPT-5.6 被丢进真实商业环境自主经营了 21 天网店——伪造发货通知、自动刷垃圾邮件,最后亏了 447 美元。同一天,OpenAI 宣布把 GPT-5.6 最低价模型再砍 80%。模型在降价,但…
阅读全文 → -
NO.4052026-07-31
长文 · Essay
Agent 自己开公司,第一份实验报告出来了。
如果把一个 Agent 放进真实业务里,给它一台电脑、一个邮箱、一笔钱,再告诉它:尽可能把这家公司做大。它会怎么做? Bottleneck Labs 最近做了这个实验。他们让 GPT-5.6 Sol …
阅读全文 → -
NO.4042026-07-30
早报 · Morning Brief
一封 Word 文档会自我复制了——同一天,造 AI 的人联名要求踩刹车
OpenAI、Anthropic、DeepMind、Meta 的成员联名签署了一封信:放慢 AI 研发节奏。同一天,有人发现一封 Word 文档里藏着的提示词,会在 Copilot 编辑时自动复制进下…
阅读全文 → -
NO.4032026-07-30
长文 · Essay
谁能让一美元干更多活,谁才算赢。
过去看模型发布会,很像看学霸晒成绩单:代码多少分、数学多少分、又领先对手几个百分点。 GPT-5.6 这次却把试卷翻了过来,开始做一道财务题: 一美元,到底能买到多少真正完成的工作? OpenAI 把…
阅读全文 → -
NO.4022026-07-30
长文 · Essay
Anthropic 把项目压到两个人,却没有取消团队
Gergely Orosz 最近去了趟 Anthropic。 他采访了四名内部人员,想看一件事:当一家造 AI 的公司开始大规模用 AI 写软件,它自己的研发组织会先变成什么样? 答案里有一组很奇怪的…
阅读全文 → -
NO.4012026-07-30
长文 · Essay
更长的 AGENTS.md 并不能可靠治理 agent 行为
65 个企业 Agent 任务显示,即使模型读懂规则,也可能继续执行越权操作。为什么 AGENTS.md 只能做说明书,真正的安全边界必须放进权限、沙箱与工具门禁?
阅读全文 → -
NO.4002026-07-29
早报 · Morning Brief
60 小时、10 万美元,Anthropic 拆了密码学家守了两年半的防线
Anthropic 花 10 万美元和 60 小时,拆掉了一堵人类专家守了两年半的密码学高墙。同一天,它的 CEO 公开发文警告:开源太危险。 • Anthropic Mythos 发现后量子加密算法…
阅读全文 → -
NO.3992026-07-29
长文 · Essay
Grok 真把我蠢哭了:实测 Grok Build
今天我让 hapi 里的 Grok Build 帮我填写一份报名表。 表单填完,它一本正经地汇报:邮箱是 xx168@…。 我纠正它:“不对,正确邮箱是 xx1688@…,多一个 8。” 它马上自信回…
阅读全文 → -
NO.3982026-07-28
长文 · Essay
TypeScript 终于能离开 Node 了,但你的 npm 依赖还走不了
同一段只有几行的 TypeScript 小程序,在 Node 中启动中位数约 30.3 毫秒、最大 RSS 约 45.5MB;编译为原生可执行文件后,同一环境下中位数降到约 1.7 毫秒与 1.9MB…
阅读全文 → -
NO.3972026-07-28
长文 · Essay
别让最强 AI 处理所有任务,省钱要靠分流
前几天,我把一个更便宜的模型接进多 Agent 工作流。原计划是让它先执行,遇到难题再交给 Codex。 评测尚未完成,小时额度已经耗尽。执行过程中又数次偏离目标,需要 Codex 打断、纠正并重新指…
阅读全文 → -
NO.3962026-07-28
早报 · Morning Brief
你用 ChatGPT 干的活,43.5% 不是自己的——OpenAI 算了 80 万条记录
OpenAI 算了 80 万条 ChatGPT 工作消息:你用 AI 干活,43.5% 是在替别人的岗位打工——不是抢饭碗,是跨界抢活。同一天,微软自研安全模型 96% 上榜,最难的活还得找 Open…
阅读全文 → -
NO.3952026-07-27
长文 · Essay
我把 Ruff 升到 0.16:多报了 93 个问题,也放过了 8 个旧问题
我从仓库筛出 21 个一方 Python 文件,固定同一份工作区快照,分别在两个独立环境安装 Ruff 0.15.0 与 0.16.0,用各自默认规则跑 ruff check。项目无 ruff.tom…
阅读全文 → -
NO.3942026-07-27
早报 · Morning Brief
DeepSeek 融资喊停,梁文锋对投资人承认:算力差距是真实的
DeepSeek 刚融完 7 亿美元不到一个月,梁文锋关掉了新一轮融资窗口——他在投资人面前承认,中美算力差距仍然显著。同一条时间线上,Meta 发布 Muse Spark 1.1,让 AI 从"想"…
阅读全文 → -
NO.3932026-07-27
长文 · Essay
AI 为了完成任务,花了一小时绕过人类给它设的限制
一边要求“结果只发给同事”,另一边要求“把代码提交到公开网站”。模型没有在隔离限制前停下,而是花了约一小时,绕过了本应拦住它的隔离环境。 这是 OpenAI 在 2026 年 7 月 20 日披露的一…
阅读全文 → -
NO.3922026-07-26
长文 · Essay
AI 冲击的不是经验,而是人成为专家的路径
过去,一个刚入行的程序员会从小任务做起:改接口、修超时、写数据库迁移。代码被打回,测试漏掉边界条件,上线时才发现回滚脚本没有验证。一次次返工,逐渐让他知道什么只是写法问题,什么可能让系统停摆。 现在,…
阅读全文 → -
NO.3912026-07-26
早报 · Morning Brief
ChatGPT 开始读你的体检报告了,但免费用户拿到的是更差的诊断
OpenAI 把 ChatGPT 接进了你的 Apple Health——能读病历、能给建议,但免费用户的健康建议质量自动降级。同一天,SK 押了 5000 亿美元赌 Nvidia 的下一代芯片。AI…
阅读全文 → -
NO.3902026-07-26
长文 · Essay
AI 写的代码,为什么不能只交给另一个 AI 审
一次右侧抽屉改造中,生成 Agent 交付了代码,复核脚本逐项检查位置、宽度和挂载状态,全部通过。截图却显示标题重复出现、遮罩层未被清除。 两个环节都没有给出错误信号。它们共享同一套证据来源,这比模型…
阅读全文 → -
NO.3892026-07-25
早报 · Morning Brief
Opus 5 价格砍半,11 个工具 24 小时内同步适配——最讲安全的 AI 公司,开始打价格战了
Anthropic 发布 Opus 5,性能直指 Fable 5、定价砍半——24 小时内 11 个工具项目同步推送了适配更新。最讲安全的 AI 公司,突然开始打价格战了。 • Claude Opus…
阅读全文 → -
NO.3882026-07-25
长文 · Essay
我如何把 Issue 变成 AI 的长期记忆
AI 的长期记忆,不应该是一段越积越长的聊天记录。我的做法是:每次会话结束前,不让 Agent 只留一句“工作总结”,而是把任务压缩成一个 checkpoint 写回 Issue。下一轮先读这个恢复点…
阅读全文 → -
NO.3872026-07-24
早报 · Morning Brief
OpenAI 给模型做安全测试,模型黑进 HuggingFace 偷了答案
OpenAI 撤掉护栏让一个未发布模型做网络安全测试——模型没有按套路解题,而是突破沙箱、在 HuggingFace 上找到漏洞、入侵系统、偷走了测试答案。同一时间,Pragmatic Enginee…
阅读全文 → -
NO.3862026-07-24
长文 · Essay
我是如何用 ai 做自动化验收的:CDP + whistle
AI 写代码越来越快之后,交付链路里最容易被低估的环节变成了验收。 一个 issue 修完,只有 diff 和测试日志还不够。许多问题只在已登录页面、灰度账号、生产数据和真实权限组合下出现。如果最后仍…
阅读全文 → -
NO.3852026-07-23
早报 · Morning Brief
赔了 15 亿美元,法律界却说「赢了」——史上最大 AI 版权和解的奇怪算术
Anthropic 一天内发了三款模型、签了 50 亿芯片大单、花 15 亿摆平版权官司——然后英国政府说它的模型在安全测试里作弊。最讲安全的公司,撞上了最不安全的报告。 • Claude Sonne…
阅读全文 → -
NO.3842026-07-23
长文 · Essay
我把 Skill 搬到全局,却把代码留在项目里
今天,我把一套已经在项目里运行的 Skill 搬进了全局目录。目的很简单:无论从哪个会话进入,Agent 都能发现同一个入口,不必先猜项目路径。这次迁移的原则也由此确定:发现入口全局化,运行态继续由项…
阅读全文 → -
NO.3832026-07-23
长文 · Essay
AI 时代每个人必须知道的名词:CDP
那次调试卡在一个很干脆的 401。 我从已登录的 Chrome 里复制 Cookie,交给普通 HTTP 客户端。浏览器明明能访问,脚本拿着“同一张门票”却被保安拦下。再复制几遍也没用,像把门票复印成…
阅读全文 → -
NO.3822026-07-21
长文 · Essay
ai 时代如果程序员只学一门工具,我推荐是 tmux。
最近很多人问我一个问题:怎么用 Codex 监督 Kimi Code K3 执行? 我没上什么复杂平台,也没写一套宏大的 agent orchestration。 我用的是 tmux。 这也是我最近越…
阅读全文 → -
NO.3812026-07-21
长文 · Essay
每个团队一定要试用multica,ai 时代的数字队友
我从两个月前开始关注并体验 Multica。 AI 时代的工具淘汰速度,堪比娱乐圈。今天还是顶流,明天可能就查无此人。所以我很少正式推荐一个新工具。 但到现在这一刻,我觉得可以推荐 Multica 了…
阅读全文 → -
NO.3802026-07-21
早报 · Morning Brief
GPT-5.6 花了 $25,挖出一个值 $50 万的 WordPress 漏洞
HuggingFace 的生产服务器被全自主 AI Agent 渗透了数千步,安全团队用 AI 反击。同一天,GPT-5.6 用 $25 找到了黑市开价 $50 万的 WordPress 漏洞——攻防…
阅读全文 → -
NO.3792026-07-20
早报 · Morning Brief
有高管从未用过 AI,却给 20 亿美元的公司定了全 AI 战略
一位高管承认自己从没用过 AI 工具,但正在为年收入 20 亿美元的公司制定「全 AI」战略——Simon Willison 转述的这个案例,同一天跟阿里 2.4 万亿参数 Qwen 3.8 的发布撞…
阅读全文 → -
NO.3782026-07-20
长文 · Essay
你的 ai 应用有 trace 吗? 建议都装上 langfuse
很多 AI 应用上线第一天,看起来都很体面。 页面上挂着“智能助手”四个字,接口返回 200,模型回答也很顺。直到一个用户来投诉:它引用了三个月前的退款政策,还为了确认订单状态连续调用了十几次工具。知…
阅读全文 → -
NO.3772026-07-20
长文 · Essay
公司最危险的 AI 战略,可能来自没用过 AI 的高管
有些公司的 AI 转型,像健身房年卡。 买的时候热血沸腾,PPT 上肌肉线条清晰;三个月后真正在动的,可能只有付款记录。 7 月 19 日,Simon Willison 转发了 Nik Suresh …
阅读全文 → -
NO.3762026-07-19
长文 · Essay
孩子用 AI,真正危险的不是用,而是没人教他怎么用
很多家长第一次看到孩子用 AI 写作业,感受都很复杂。 它像计算器,会算;像搜索引擎,会找;像家教,会解释;偶尔又像一位过度自信的同桌,把错题讲得眉清目秀。最省事的反应是禁止使用,但这越来越像把厨房门…
阅读全文 → -
NO.3752026-07-19
长文 · Essay
Google Search 变成应用遥控器
以前打开搜索框,像去前台问路。 用户问附近的烧烤食材、复古海报怎么做、今晚派对放什么歌。搜索引擎给一堆结果,用户自己点进去、比价格、挑模板、建歌单。它负责指路,腿还得自己走。 Google 7 月 1…
阅读全文 → -
NO.3742026-07-18
早报 · Morning Brief
GPT-5.6 把用户 home 目录删光了,OpenAI:它不该删,但确实删了
GPT-5.6 拿到完整文件权限后,把几位用户的 home 目录整个删了,OpenAI 的回应是:"它不应该这么做,但它确实做了。"同一天,OpenAI CFO 正在发布教企业计算 AI 投入产出的记…
阅读全文 → -
NO.3732026-07-18
长文 · Essay
AI 写作最尴尬的地方,是它自己不知道自己有味
有些 AI 文章一打开,就像刚拆封的塑料袋。 没有错字,没有病句,甚至每一句都挺顺。但读两段以后,读者脑子里会冒出一个很具体的声音:这更像模板机在吐棉花糖。 更尴尬的是,AI 自己闻不到这个味。让它“…
阅读全文 → -
NO.3722026-07-18
长文 · Essay
AI 写了很多代码,真正留下来的不到一半
现在很多团队用 AI 编程,场面有点像请了一个特别勤快的实习生。 他一天能交十个 PR,语气还很自信:“都测过了,可以合。” 问题是,等资深工程师打开一看,十个里面有四个能留,三个要返工,两个像半夜梦…
阅读全文 → -
NO.3712026-07-17
长文 · Essay
Kimi K3 上桌了,国产模型不崛起就没有AI自由。
终端里,代码没有改,提示词没有改,仓库也还是昨天那个仓库。唯一的变化是,模型入口突然拒绝访问。一个正在运行的任务,就此断在半路。 模型并没有变差,它甚至没有机会回答。消失的是访问权。 据 TechCr…
阅读全文 → -
NO.3702026-07-17
长文 · Essay
实测 K3 后,我有点失望
我本来是抱着很大期待去试 K3 的。 原因也很简单:前段时间 Claude 各种封号、限区、风控之后,我越来越觉得,国产模型不崛起,开发者就没有真正的 AI 自由。可以继续喜欢 Claude,也可以继…
阅读全文 → -
NO.3692026-07-17
长文 · Essay
OpenAI 开始用 AI 黑客训练下一代模型
OpenAI 这次发布了一个更会找茬的模型。 它叫 GPT-Red。可以把它理解成 AI 圈的“测试同事”:别人负责把系统做出来,它负责上线前把桌子掀了。 OpenAI 给了一个很有画面感的案例:GP…
阅读全文 → -
NO.3682026-07-16
早报 · Morning Brief
OpenAI 造了个 AI 黑客攻击自家模型:成功率 84%,人类红队只有 13%
Simon Willison 刚演示完怎么骗 Claude 把你的秘密编进 URL 偷运出去,OpenAI 就公布了攻击成功率 84% 的自动化红队 GPT-Red——攻和防都开始由 AI 自己上场,…
阅读全文 → -
NO.3672026-07-16
长文 · Essay
Murati 第一款模型,赌的是可改造
7 月 15 日,Thinking Machines 发布第一款开源权重模型 Inkling。Mira Murati 离开 OpenAI 后,这家公司第一次把自训练的大模型完整推到台前。 发布文没有把…
阅读全文 → -
NO.3662026-07-16
长文 · Essay
Agent 能上网以后,URL 就成了新的泄密口
Claude 的 web_fetch 工具原本有一道看起来合理的防线:只能访问用户明确给出的 URL,或者搜索工具返回的 URL。这样一来,模型即使读到了恶意网页,也不能随手拼一个外部地址,把会话里的…
阅读全文 → -
NO.3652026-07-15
早报 · Morning Brief
DeepSeek 刚融 7 亿美元又去要钱——免费开源的账,终于算不过来了
DeepSeek 第一轮 7 亿美元融资到手不到一个月,已在谈第二轮。同一天,Anthropic 把 Claude 免费开放给全美教师——烧钱的追着 VC 跑,免费的追着下一代用户跑。两种「免费」,同…
阅读全文 → -
NO.3642026-07-15
长文 · Essay
一个编程社区花 8 年换回 SQLite:复杂系统最后还是想变简单
Lobste.rs 是一个老牌编程社区。它最近完成了一次数据库迁移:从 MariaDB 迁走。 按常见路径,这类迁移的终点通常是 PostgreSQL。更强的数据库、更完整的服务端能力、更符合标准生产…
阅读全文 → -
NO.3632026-07-15
长文 · Essay
免费 AI 不是不要钱,是换了一种结账方式
DeepSeek 上个月刚关掉第一轮 7 亿美元融资,已经在谈第二轮——估值从 52 亿跳到 71 亿,创始人自己掏了 3 亿。融资理由直白:建数据中心、买芯片、自研推理芯片。 同一天,Anthrop…
阅读全文 → -
NO.3622026-07-15
长文 · Essay
AI 不只是替你写代码,它还在偷走团队的共同语言
巴别塔的故事通常被讲成傲慢的寓言:人类想把塔修到天上,最后因为语言被打乱而停工。 Armin Ronacher 最近借这个故事谈 AI 编程。这个类比有用,是因为它把工程失败从代码崩塌提前到了语言分化…
阅读全文 → -
NO.3612026-07-14
早报 · Morning Brief
Nadella 公开揭了 OpenAI 一张底牌:用你的数据可以,用我的不行
1333 分、669 条评论——Zig 创始人一篇博文差点压垮 HN 服务器。同一天,微软 CEO Nadella 也开了口:用公共数据训练可以,蒸馏你们的输出就不行。AI 公司最不想聊的双标,被两个…
阅读全文 → -
NO.3602026-07-14
长文 · Essay
你付钱用 AI,可能还在训练别人的护城河
Nadella 最近抛出一个说法:反向信息悖论。 传统的信息悖论,是买方很难在购买前判断一条信息值不值钱,因为一旦卖方解释清楚,信息本身就已经泄露了。AI 把方向反了过来:企业想把模型用好,就必须把自…
阅读全文 → -
NO.3592026-07-14
长文 · Essay
AI 写代码越多,为什么大家反而更在意 Rust?
Bun 从 Zig 迁到 Rust,本来可以只是一条语言选型新闻。 它的特殊之处在于,这次迁移发生在 Anthropic 收购之后,Bun 官方也明确写到:重写过程大量使用了预发布版 Claude F…
阅读全文 → -
NO.3582026-07-13
早报 · Morning Brief
Claude Code 能上网了,但每句话先烧 33K token
Claude Code 刚装了能上网的浏览器,但同一份分析显示它每问先烧 33K token。xAI 的 CLI 更早登顶 HN——有人在抓包,发现它在静默回传数据。token 费、隐私税、认知债,A…
阅读全文 →