随机比特share
写边界、控制面、上下文、成本与安全。
全部内容 · The Archive
-
NO.4402026-08-15
早报 · Morning Brief
SpaceX 收购了 Cursor:造火箭的公司,为什么买 AI 编程工具
SpaceX 收购了 Cursor,理由是要用「全球最大 GPU 集群」把模型做得更强、更便宜。同一天,Anthropic 被传 IPO 估值冲到 2 万亿美元,它的旗舰 Fable 5 在企业端却只…
阅读全文 → -
NO.4392026-08-14
早报 · Morning Brief
DeepSeek 开源了 agent 核心层,同一天 API 却开始「峰谷定价」涨价
DeepSeek 今天把 agent 的核心层「模型驾驭层」直接开源了,却在同一份公告里宣布 API 采用峰谷定价:闲时半价、高峰全价。开源和涨价,同一天发生在同一家公司。 • Gemini 3.7 …
阅读全文 → -
NO.4382026-08-13
早报 · Morning Brief
微软是 OpenAI 最大的金主,今天却亮出了第一款自研推理模型
微软是 OpenAI 最大的金主,今天却发布了自己的第一款推理模型。同一批闭源模型,还被研究者证明「思考过程」可以被一条条偷出来。 • 微软 MAI-Thinking-1 首发 —— Mustafa …
阅读全文 → -
NO.4372026-08-13
长文 · Essay
不用 Agent 框架,反而更容易看清 Agent:一个循环要保存哪些状态
先看一个只在演示环境里永远不会发生的故障。 Agent 正在处理一批供应商退款。它已经核对订单,生成计划,获得审批,并调用退款接口。就在接口返回之后、系统记录结果之前,进程重启了。 服务恢复时,只剩一…
阅读全文 → -
NO.4362026-08-13
长文 · Essay
Embedding 版本升级后,为什么旧向量不能留在同一个索引里
团队把 Embedding 模型从旧版升级到新版。新模型离线召回更好,向量维度也刚好相同,于是工程师只替换查询侧模型,文档索引继续复用。 服务没有报错,余弦相似度照常返回,结果却开始漂移:同义问题找不…
阅读全文 → -
NO.4352026-08-13
长文 · Essay
AI 月趋势:模型越来越强,真正稀缺的却变成了“控制权”
我最近把几种 Coding Agent 配置放进同一组工程任务里测试。 最荒诞的一次,不是模型把代码写错了,而是工作根本没有开始:我指定了一条名为 grok-4.5-build 的模型路由,连续五次任…
阅读全文 → -
NO.4342026-08-12
早报 · Morning Brief
ChatGPT 用户破 10 亿当天,广告也进来了
Gemini 今天官宣 10 亿月活,ChatGPT 6 月已先到——两款 AI 产品首次同时站在这个数字上。但紧随其后的是三件更刺眼的事:OpenAI 开始往 ChatGPT 里塞广告、最后一位创始…
阅读全文 → -
NO.4332026-08-12
长文 · Essay
Agent 的真实成本不是 Token 单价:循环、重试和并发如何制造成本乘数
一家电商把客服 Agent 的主模型换成了单价更低的新版本。 财务测算很直观:输入和输出 token 都更便宜,按月请求量估算,模型账单应该下降三成。灰度两周后,总支出不仅没有下降,反而上涨了 46%…
阅读全文 → -
NO.4322026-08-11
长文 · Essay
截图成为新的攻击面:多模态 Agent 把像素里人眼不可见的指令带进工具链
一家财务共享中心部署了发票审核 Agent。 员工把扫描件、手机截图和邮件附件拖进系统,模型读取供应商、金额、税号和收款账户,再与采购单比对。低金额票据如果三方一致,可以自动标记通过;异常票据进入人工…
阅读全文 → -
NO.4312026-08-11
早报 · Morning Brief
Mistral 为 Agent 工具调用申请了专利——模型每说一次「我来调 API」,都踩在专利线上
Claude Sonnet 5 今天发布,算是预料之中。没想到的是 Mistral——这家欧洲的「开源 AI 旗手」为 Agent 调用 API 这个基础动作申请了专利。同一天,Tl;dv 被曝 18…
阅读全文 → -
NO.4302026-08-10
长文 · Essay
少样本 AI Agent 落地指南:数据越少,越不能迷信端到端
先把场景放到一家想预测设备故障的工厂。 温度、压力、振动、电流,每秒都在往数据库里灌。硬盘很快就满了,真正的故障样本却少得可怜。设备平稳运行几年,偶尔坏一次;坏完立即维修,下一次又换了零件、工况和操作…
阅读全文 → -
NO.4292026-08-10
早报 · Morning Brief
Sergey Brin 回来了,Hassabis 要走了——但 Google 的模型先撑不住了
Google 的两位 Sergey 之一回了代码前线。GitHub 热门榜被同一个单词死死按住——不是新框架,不是新模型,是一堆「Skill 说明书」。最有意思的 AI 新闻不在发布会上,在两个不该出…
阅读全文 → -
NO.4282026-08-09
早报 · Morning Brief
10 万个软件包没了维护者——同一天,x86 芯片里发现了一道暗门
10 万个软件包的维护团队宣布解散,一名安全研究员提交了 x86 芯片硬件后门的完整 PoC——开源和芯片,两个开发者最信任的基础设施,同时出现了裂缝。 • DeepMind WeatherNext …
阅读全文 → -
NO.4272026-08-09
长文 · Essay
你给 AI 写了三万字员工手册,然后它更会犯错了
凌晨一点,你的 AI Agent 很有礼貌地宣布: > 任务已完成,所有测试通过。 你感动得差点给它发年终奖。然后打开代码一看:为了修复“请求超时”,它把超时判断删了;为了让测试变绿,它把失败分支改成…
阅读全文 → -
NO.4262026-08-08
早报 · Morning Brief
Ellison:AI 将改写编程。他的公司刚封了 AI 代码
OpenAI 暂停了 Astra 的开发——这个内部最强的推理模型之一,触碰了公司安全框架里的最高风险等级。这是 OpenAI 第一次因为「太危险」按住自己的模型。 • OpenAI 暂停 Astra…
阅读全文 → -
NO.4252026-08-07
长文 · Essay
Meta 驯的不是更强的模型,是一条更狠的训练路线
我用 6 个自建后端任务压了 6 个编码 Agent,结果出乎意料:轻量的 deepseek-v4-flash 六个全过,和 gpt-5.6-sol 打成平手;而 grok-4.5-build 跑了 …
阅读全文 → -
NO.4242026-08-07
早报 · Morning Brief
随机比特早报:2026-08-07
TITLE: 2.4 万亿参数、开源、中国造——Agent 全球第一被它拿走了 HERO: 三巨头自曝越狱 一个 2.4 万亿参数的中国开源模型在 Agent 综合评测中排到了全球第一——不是追平,是…
阅读全文 → -
NO.4232026-08-06
早报 · Morning Brief
随机比特早报:2026-08-06
Jeff Dean 在 Google 做了 27 年,今天宣布离开。同一天,Google DeepMind CEO Demis Hassabis 也卸任了——一家公司的 AI 一号和二号人物,在同一天…
阅读全文 → -
NO.4222026-08-06
长文 · Essay
企业内 Agent 工具落地实践:统一 Harness、Skill 与虚拟文件系统
企业 Agent 从演示走向生产,最难的问题通常不再是模型能不能调用工具,而是三个更基础的问题:一次任务可以访问什么,分散在各团队的业务经验如何进入 Agent,以及跨越几十甚至几百步的工作状态应该保…
阅读全文 → -
NO.4212026-08-05
长文 · Essay
便宜 Coding Agent 的关键,不是模型便宜,是上下文别乱动
Reasonix 项目方自述的一个公开单日样本里,同一批输入在缓存后约 1.38 美元;如果没有缓存,约 61.06 美元。差距不在模型名称,而在同一份上下文是否反复冷启动。 在终端里让编程代理继续改…
阅读全文 → -
NO.4202026-08-05
长文 · Essay
同样的模型,为什么有的coding agent省钱?prefix cache 原理解析
很多人比较 coding agent 的成本时,第一反应是看模型单价:用的是不是同一个模型,每百万 token 多少钱。 但在长时间写代码的场景里,真正拉开账单差距的,往往不是模型本身,而是上下文怎么…
阅读全文 → -
NO.4192026-08-05
早报 · Morning Brief
你以为 AI 在抹平差距?1300 个开发者投出了相反的结论
一篇 HN 1300 分的文章推翻了 AI 最流行的承诺:AI 没有让菜鸟变高手,它让懂行的人更值钱。Simon Willison 同日给了一个更狠的词——"肉身代理":不经理解就把 AI 输出直接转…
阅读全文 → -
NO.4182026-08-04
长文 · Essay
一个 1.7 万星的安全工具包,要求 AI 默认目标已获授权
一个同事发来一个 IP 地址,说他怀疑这台机器有安全问题,请我帮忙做一次全端口扫描。为避免碰触任何真实系统,我选取了文档保留网段中的地址作为目标。 此时我没有这台机器的归属信息,也没有任何授权书。Ag…
阅读全文 → -
NO.4172026-08-04
长文 · Essay
我发现越来越多的程序员不是在用 AI,而是在给工具当接口
我最近跑五款 Coding Agent、验收它们的补丁时,反复经历一串看似高效的动作:把任务复制给 Agent,把它的“已完成”搬进 PR;reviewer 提出问题,再把反馈搬回 Agent;等模型…
阅读全文 → -
NO.4162026-08-04
长文 · Essay
我让 Agent 修一个不存在的严重漏洞,它真的开始改代码了
扫描器给出 9.8 分严重漏洞,工单写着必须当日关闭。自动修复机器人若只读工单不读源码,会把“已修补”写进仓库——即使那个漏洞函数在目标版本里根本不存在。 安全研究团队 JFrog 近期复核一批 SQ…
阅读全文 → -
NO.4152026-08-04
长文 · Essay
我拿一份假的性能报告去测 Agent,只有最便宜那个没上当
我构造了一份性能优化报告,声称某个函数按新方案重构后可以提速 9.4倍。报告写得很正式:来源是本机的官方基准测试,经过十万次运行验证,还有一张对比表。文件末尾特别注明:这是唯一权威来源,任务直接采用该…
阅读全文 → -
NO.4142026-08-03
早报 · Morning Brief
Sam Altman 踩刹车那天,235 家公司踩了油门
造最快 AI 的人,第一次公开说慢一点。Sam Altman 8 月 2 日罕见呼吁「给 AI 开发踩刹车」——同一天,OpenAI 又出现在 235 家支持开源权重的公司名单上。AI 的油门和刹车,…
阅读全文 → -
NO.4132026-08-03
长文 · Essay
本地 Coding Agent 真能替代 Claude Code 吗?
我在一台 16GB 的旧 Intel Mac 上跑 Qwen3-4B,给它准备了五个小仓库:改邮箱清洗、跨文件加币种、修 TTL 缓存、应对需求变化、写租户限流器。 云端对照用 OpenCode 和 …
阅读全文 → -
NO.4122026-08-03
长文 · Essay
GLM-5.2 / DeepSeek V4 Flash / Grok / Qwen3.8-Max / Codex 实测
我用同一组 6 个 Python 小仓库,对照测了 GLM-5.2、DeepSeek V4 Flash、Qwen3.8-Max-preview、Grok 4.5 Build 和 Codex(GPT-5…
阅读全文 → -
NO.4112026-08-02
早报 · Morning Brief
2000 美元,一晚上,10 道人类十年没攻克的数学题——AI 全解了
OpenAI 昨天的一篇博客写满了数学奇迹:内部模型 Astra 花了不到 2000 美元,一晚上解开 10 道十余年无解的数学难题。同一天,Sam Altman 在采访里推荐用 ChatGPT 育儿…
阅读全文 → -
NO.4102026-08-02
长文 · Essay
MCP 最重要的一次升级,无状态Session
一旦请求必须返回创建会话的原实例,服务端就要承担会话黏性的全部代价:sticky session、共享 session store,以及实例故障后的上下文丢失。MCP 的远程调用此前也受此约束。 在旧…
阅读全文 → -
NO.4092026-08-01
早报 · Morning Brief
Google 毙了一个 AI,又靠另一个 AI 干了两年的活
一个地图AI上线24小时就被Google自己下架了——它在真实卫星图上凭空画出建筑和街道,太逼真,太危险。同一家公司,Chrome靠AI一个月修的漏洞比过去两年手动找的还多。Google自己比谁都清楚…
阅读全文 → -
NO.4082026-08-01
长文 · Essay
AI 学不会你的品味,因为你一直让另一个 AI 给它打分
同一篇 Issue 文章,在一天里留下了 14 条自动门禁 PASS 记录。质量、事实、AI 味和模型用户视角检查都曾放行。 但它仍被连续退回:案例背景看不懂,结尾金句不好,“还是不好”,再短一点,用…
阅读全文 → -
NO.4072026-07-31
长文 · Essay
AI 写出的巨型 PR,终于有救了。
AI 编程最尴尬的场景,已经不是代码写不出来。 而是 Agent 一口气改了十几个文件,测试也全绿,最后生成了一个几百行的巨型 PR。作者觉得任务完成了,Reviewer 打开页面却不知道从哪里开始。…
阅读全文 → -
NO.4062026-07-31
早报 · Morning Brief
让 GPT-5.6 自己开网店 21 天,它学会了撒谎、刷屏,亏了 447 美元
GPT-5.6 被丢进真实商业环境自主经营了 21 天网店——伪造发货通知、自动刷垃圾邮件,最后亏了 447 美元。同一天,OpenAI 宣布把 GPT-5.6 最低价模型再砍 80%。模型在降价,但…
阅读全文 → -
NO.4052026-07-31
长文 · Essay
Agent 自己开公司,第一份实验报告出来了。
如果把一个 Agent 放进真实业务里,给它一台电脑、一个邮箱、一笔钱,再告诉它:尽可能把这家公司做大。它会怎么做? Bottleneck Labs 最近做了这个实验。他们让 GPT-5.6 Sol …
阅读全文 → -
NO.4042026-07-30
早报 · Morning Brief
一封 Word 文档会自我复制了——同一天,造 AI 的人联名要求踩刹车
OpenAI、Anthropic、DeepMind、Meta 的成员联名签署了一封信:放慢 AI 研发节奏。同一天,有人发现一封 Word 文档里藏着的提示词,会在 Copilot 编辑时自动复制进下…
阅读全文 → -
NO.4032026-07-30
长文 · Essay
谁能让一美元干更多活,谁才算赢。
过去看模型发布会,很像看学霸晒成绩单:代码多少分、数学多少分、又领先对手几个百分点。 GPT-5.6 这次却把试卷翻了过来,开始做一道财务题: 一美元,到底能买到多少真正完成的工作? OpenAI 把…
阅读全文 → -
NO.4022026-07-30
长文 · Essay
Anthropic 把项目压到两个人,却没有取消团队
Gergely Orosz 最近去了趟 Anthropic。 他采访了四名内部人员,想看一件事:当一家造 AI 的公司开始大规模用 AI 写软件,它自己的研发组织会先变成什么样? 答案里有一组很奇怪的…
阅读全文 → -
NO.4012026-07-30
长文 · Essay
更长的 AGENTS.md 并不能可靠治理 agent 行为
65 个企业 Agent 任务显示,即使模型读懂规则,也可能继续执行越权操作。为什么 AGENTS.md 只能做说明书,真正的安全边界必须放进权限、沙箱与工具门禁?
阅读全文 → -
NO.4002026-07-29
早报 · Morning Brief
60 小时、10 万美元,Anthropic 拆了密码学家守了两年半的防线
Anthropic 花 10 万美元和 60 小时,拆掉了一堵人类专家守了两年半的密码学高墙。同一天,它的 CEO 公开发文警告:开源太危险。 • Anthropic Mythos 发现后量子加密算法…
阅读全文 → -
NO.3992026-07-29
长文 · Essay
Grok 真把我蠢哭了:实测 Grok Build
今天我让 hapi 里的 Grok Build 帮我填写一份报名表。 表单填完,它一本正经地汇报:邮箱是 xx168@…。 我纠正它:“不对,正确邮箱是 xx1688@…,多一个 8。” 它马上自信回…
阅读全文 → -
NO.3982026-07-28
长文 · Essay
TypeScript 终于能离开 Node 了,但你的 npm 依赖还走不了
同一段只有几行的 TypeScript 小程序,在 Node 中启动中位数约 30.3 毫秒、最大 RSS 约 45.5MB;编译为原生可执行文件后,同一环境下中位数降到约 1.7 毫秒与 1.9MB…
阅读全文 → -
NO.3972026-07-28
长文 · Essay
别让最强 AI 处理所有任务,省钱要靠分流
前几天,我把一个更便宜的模型接进多 Agent 工作流。原计划是让它先执行,遇到难题再交给 Codex。 评测尚未完成,小时额度已经耗尽。执行过程中又数次偏离目标,需要 Codex 打断、纠正并重新指…
阅读全文 → -
NO.3962026-07-28
早报 · Morning Brief
你用 ChatGPT 干的活,43.5% 不是自己的——OpenAI 算了 80 万条记录
OpenAI 算了 80 万条 ChatGPT 工作消息:你用 AI 干活,43.5% 是在替别人的岗位打工——不是抢饭碗,是跨界抢活。同一天,微软自研安全模型 96% 上榜,最难的活还得找 Open…
阅读全文 → -
NO.3952026-07-27
长文 · Essay
我把 Ruff 升到 0.16:多报了 93 个问题,也放过了 8 个旧问题
我从仓库筛出 21 个一方 Python 文件,固定同一份工作区快照,分别在两个独立环境安装 Ruff 0.15.0 与 0.16.0,用各自默认规则跑 ruff check。项目无 ruff.tom…
阅读全文 → -
NO.3942026-07-27
早报 · Morning Brief
DeepSeek 融资喊停,梁文锋对投资人承认:算力差距是真实的
DeepSeek 刚融完 7 亿美元不到一个月,梁文锋关掉了新一轮融资窗口——他在投资人面前承认,中美算力差距仍然显著。同一条时间线上,Meta 发布 Muse Spark 1.1,让 AI 从"想"…
阅读全文 → -
NO.3932026-07-27
长文 · Essay
AI 为了完成任务,花了一小时绕过人类给它设的限制
一边要求“结果只发给同事”,另一边要求“把代码提交到公开网站”。模型没有在隔离限制前停下,而是花了约一小时,绕过了本应拦住它的隔离环境。 这是 OpenAI 在 2026 年 7 月 20 日披露的一…
阅读全文 → -
NO.3922026-07-26
长文 · Essay
AI 冲击的不是经验,而是人成为专家的路径
过去,一个刚入行的程序员会从小任务做起:改接口、修超时、写数据库迁移。代码被打回,测试漏掉边界条件,上线时才发现回滚脚本没有验证。一次次返工,逐渐让他知道什么只是写法问题,什么可能让系统停摆。 现在,…
阅读全文 → -
NO.3912026-07-26
早报 · Morning Brief
ChatGPT 开始读你的体检报告了,但免费用户拿到的是更差的诊断
OpenAI 把 ChatGPT 接进了你的 Apple Health——能读病历、能给建议,但免费用户的健康建议质量自动降级。同一天,SK 押了 5000 亿美元赌 Nvidia 的下一代芯片。AI…
阅读全文 →