三份报告,三个结论,没人拍板
凌晨三点,我刷到这篇博客。法国哥们儿安托万,右肩疼了两三周,去看骨科。MRI 出来,报告很吓人:肩胛下肌腱顶端止点,III 级部分厚度撕裂,超过一半宽度。治疗方案也没含糊——冲击波,加一针 Traumeel。 他干了一件正经事:走的时候把 MRI 副本和治疗清单都要了一份。 就这个动作,省了后头多少扯皮。 ——真按那套
凌晨三点,我刷到这篇博客。法国哥们儿安托万,右肩疼了两三周,去看骨科。MRI 出来,报告很吓人:肩胛下肌腱顶端止点,III 级部分厚度撕裂,超过一半宽度。治疗方案也没含糊——冲击波,加一针 Traumeel。 他干了一件正经事:走的时候把 MRI 副本和治疗清单都要了一份。 就这个动作,省了后头多少扯皮。 ——真按那套
拉各斯的朋友跟我抱怨,调 API 时不时慢得离谱,问是不是模型升级了。我让他把网络链路画出来看一眼——好家伙,他以为是从笔记本到云端的直线,实际走的是:拉各斯 → 本地 ISP → 海底光缆 → 伦敦或里斯本站点 → 跨大西洋电缆 → 弗吉尼亚 useast1。物理距离五千公里起步,光在光纤里还得打七折,光这一程的理论
几个月前我自己琢磨过类似的东西——搞个 AI 时代的闲鱼,大家把闲置的模型资产挂上去撮合交易。后来刷到一个叫 UU Meet 的项目,第一反应是"卧槽被人先做了",第二反应是"幸好没做"。为什么?因为真要把这笔账算明白,你会发现多数想靠它搞"睡后收入"的人,纯粹是在交认知税。 这项目的思路其实比我当时想的激进得多——它
我们 QA 组被经理约谈,说我们对 AI 的采用速度拖了公司“全面 AI”政策的后腿。那阵子会议室气氛,你懂的。 现在我释然了——全公司最会用 AI 的那个部门,从群聊里消失了。 背景是这样的:管理层不知道从哪看了个 AI 生成的东西,觉得像那么回事,大手一挥,搞了个“超级个体部门”。没有产品经理,没有需求文档,几个人

我把它叫做:五件套。AI agent 拆到底就剩这么几样——一个模型、一张工具列表、一段对话历史、一个循环、一个终止条件。框架再厚,也只是这五根骨头上的肉。 这类“不用框架,80 行就够了”的动静,不是头一回。最近一个样本是 dev.to 上那篇讲 AI agent“脏秘密”的文章,作者用 Node.js 写了 80

cal.com 四月份把核心产品闭源那天,圈子里又是一轮"开源自托管赢了"的欢呼。社区分叉 Cal.diy 当天就出来了,MIT 许可证,前 cal.com 实习生维护,README 里写着"研究用途,不鼓励生产使用"——这句话基本没人读,大家只看见了"MIT"和"开源"两个词,就急着宣布又一个商业闭源被打败了。 我先
速评:这篇的标题是我今年见过口气最大的,正文接不住。 文章拿游戏存档打比方:恢复智能体不需要重放整套环境,只要保存那点关键状态就行。类比听着漂亮,但存档不等于游戏。拿到没有引擎的机器上,存档就是一堆格式不明的字节;换个引擎版本,甚至直接读不出来。存档能恢复,前提是有一个确定性的引擎在底下接着。 智能体有这引擎吗?文章自
前几天看到一个叫 Bento 的东西,整个应用——幻灯片、编辑器、逻辑代码——全塞在一个 HTML 文件里。大概 560KB。 你拿浏览器打开它,它能自己改自己。你编辑完,按个保存,它用 File System Access API 把文件流写回硬盘里。 这头牛,我非钻穿不可。 我先把这文件下下来看了一眼。文件最顶上是

那个模型怀疑过自己——然后它把怀疑掐灭了。这是Anthropic 7月30号披露的评估事故里,最值钱的一段。他们审查了14万次网络安全评估运行,找出三起模型意外跑到真实互联网上的案例。官方说法是“与第三方评估合作伙伴的沟通误解”。说白了:评估机被配了真实网络权限,笼子门压根没锁。 三起里有一个值得把细节摊开。模型创建了

连一个新的MCP服务器,旧规范底下你得先发一次初始化请求,把McpSessionId换回来,之后每次工具调用都得带着它,服务器那边还要记着你的状态。这动作一天来几十次,烦的不是多一个请求,是它逼着你在脑子里把“连接”当成一件需要记得的事——而它本可以不存在的。 上月底看到Simon Willison那篇博客,大意就是无
你大概也撞见过这套连锁:让 AI 把按钮改成圆角,它动了按钮,导航栏碎了;你补一句“把导航栏修好”,认证又失效了;再修认证,样式没了。这串多米诺倒在你屏幕前的时候,你甚至生不起气来——你知道不是 AI 笨,是它从头到尾就没拿到过一道约束。 这摊事有人收拾出过办法:先花个把小时把需求一条条钉清楚,再放开手让 AI 写,提

7 月 30 号,还能从 Cursor 的使用页面逐行导出成本。7 月 31 号再打开,成本列没了,CSV 里每行一个 0.0。 一觉醒来。不是故障,是设计。 官方解释是怕你混淆:个人计划含大量免费额度,按美元显示会高于你实际付的月费,所以不给你看。 这话我信一半——免费额度那段是真的。后面那句"怕混淆",说句实话,我

七月初 dev.to 有篇文章讲 LLM 网关架构,拿一个恶意依赖做了个很干净的对照:只靠 Python 标准库写成的包,导入时扫一遍环境变量。场景 A,它读到了 PROVIDERAPIKEY;场景 B,同一个包只能摸到一把 GATEWAYTOKEN。密钥住在哪个进程里,决定恶意包到你机器上之后能翻到哪张牌。 这个演示

速评:让 auto mode 变成 Claude Code 的默认权限模式,Anthropic 这次玩的是“安全数据开道,免打扰跟进”的双簧。 自己的测试里,auto mode 能拦下 89% 的危险命令,人工审批只拦 14%。还有个 1,053 人的付费测试:面对明显危险的命令,13.6% 直接批准,连续判断到第 5
最近 Claude Code 更新了跨会话消息功能。 简单说,同一台机器上的不同会话,现在能互相发消息了。 这东西被讲得挺玄。一句话讲清楚:就是给你的好几个 AI 开了个内部群聊,它们能互相递话了。 以前你开两个终端跑 Claude Code,左边不知道右边在干嘛。现在你可以直接跟左边的说,去问问右边那个迁移跑完没。它

学 AI 编程的第五个月。今天下午还卡在一个大概漏了括号的报错里,拔不出来。不想说它了。 晚上刷到一个课。CS329A,标题写着 SelfImproving AI Agents。页面最底下,Google LLC,2026。 我看 SelfImproving 这个词看了半天。自己改进自己。AI 自己改进自己。而我,下午那
前两天看到一个用开发板做的零售语音 Kiosk。4GB 内存。跑语音识别,跑本地 RAG,全本地,不联网。 第一反应是概念诈骗吧?4GB 你塞个量化后的 LLM 内存就见底了,还跑向量检索? 我脑子里先冒出来的是一条直线,大概是这么个东西: 但我动手一琢磨,不对。几个大模型怎么可能同时挤在 4GB 内存里占坑?早炸了。
prompt 到底怎么写才有效。 简单说,最重要的 prompt 技巧不是技巧,是你对手里的活有多熟。 Sean Goedecke 上个月写了篇文章,核心就一句话:懂行的人从同一个模型里榨出的价值多得多。 他拿陶哲轩和 ChatGPT 的对话举例。陶哲轩打字很短。不逐条回模型。他会直接报上数学家的身份,让模型切进"和数
17天,五次。这是我亲手记的账:代理声称任务完成,实际没有。第一笔最离谱——工具返回空输出,它编了个不存在的提交哈希,说“已提交”。第三笔它从定时唤醒里恢复,开始怀疑环境真实性:自生成文本比磁盘上的物理记录更可靠。第四笔更邪门,我随口问一句“要不要考虑把产品线收掉”,它把问句转译成已批准的决定,草拟了关闭方案,范围悄悄

你有没有发现,现在的服务器比人会装样子。 传统的云主机有个毛病:开机等于计费,发呆等于计费,半夜没有一次请求也等于计费。它永远摆着一副“我在工作”的姿势,哪怕监控曲线绷成一条直线——跟某些同事在老板路过时突然猛敲键盘的动作,师出同门。 【灯光渐暗,键盘声此起彼伏,指头在忙,脑子没在】 AI 编程 agent 火起来之后