上下文从 1 秒扩到 10 秒,这条就够我推一次
这条在讲 Gemini Omni 1.1 Flash,8 月 27 日发的,出处是 Google DeepMind 的 Anish Nangia 和 Alisa Fortin 署名。定位说得很清楚:面向开发者的生产就绪更新,重点放在生成式视频的控制能力上。
@shuqianke
只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。
这条在讲 Gemini Omni 1.1 Flash,8 月 27 日发的,出处是 Google DeepMind 的 Anish Nangia 和 Alisa Fortin 署名。定位说得很清楚:面向开发者的生产就绪更新,重点放在生成式视频的控制能力上。
OtoDock 是 Dimitris Mourtzis 写的自托管 agent 平台,把 Claude Code 和 Codex 当引擎,外面套一层多租户的壳。点进去之前我没抱期待——agent 平台现在一天能冒出来好几个,大部分是套个 wrapper 加个 dark mode。
这条在讲 AI 智能体全面参与开发之后,团队会慢慢丢掉一种挺重要的东西——重构本能。出处是 Rodrigo Rosenfeld Rosas,9 月 2 日发在 rosenfeld.page 上。 没法跑,观点类,我只读了。

这条在讲 AI 代理做授权时的一个问题:代理拿着用户的身份去干活,权限给多了,提示注入或者幻觉一触发,干出来的事比人工误操作狠得多。出处是 Evan Lin 在 dev.to 上的一篇笔记,7 月底发的,同时挂在他自己博客上。

上礼拜我在 Claude Code 里跑过一个实验,让模型先复述三条任务约束再动手改代码。复述零失误。动手后它碰了不该碰的文件,而且自己没发现。 上回我说跑通了复述、没跑通约束,还给自己留了个台阶——可能是我那个任务里文件耦合太紧,模型觉得不动那个文件就没法完成。
这条在讲一个计算生物学的 agent 基准,叫 BixBench3。出处是 arXiv,8 月 26 号提交的,归在计算机科学人工智能子类。原作者一共 8 位,领头的叫 Zane Koch,收尾的有 Andrew White 和 Jon M. Laurent——中间几位做蛋白设计、做感染模型的,名字太杂,不抄了。
这条在讲 P4DT,一个用来预测严重疾病患者治疗偏好的智能体。出处是 Natasha Ureyang 那组做 HCI 的人,一共12位作者。 我一开始没点。标题读起来像那种例行论文——“AI 预测准确率超过人类”——这类东西我夹子里存了好几篇,大多点开读两段就关。

MCP 工具想宣称自己只读,做法是在 schema 里标一个 readOnlyHint: true。智能体框架看到这个提示,可能就决定不用喊人工审批。我停下来了——让被审计的服务器自己给自己开风险证明,这条信任边界站不住。Himanshu Kumar 在 dev.to 那篇 Airlock 的介绍,写的也是这件事。
这条讲的是 MCP 官方 8 月 22 号更新的路线图,出处是他们自己的博客。我读完把它存进夹子的时候才发现,上一条关于 MCP 的收藏还停在 3 月份那个旧路线图——就是画了四个优先领域大饼的那篇。今天对着新旧两张图看了一遍,怎么说呢。

这条的出处是亚当,一个写代码也弹钢琴的人。他在一次 Cursor 社区活动上讲 AI 怎么改变开发方式,散场后一个不是干这行的问他:工具这么多,怎么选。 文章讲的就是他回去之后想清楚的那件事。 我一开始没打算推。标题看着像那种"AI 时代的反思"哲学稿,这种稿子通常两句就能猜完。
看到 Faith Ekstrand 在 XDC 2024 那场演示,我回去补了后续项目。这条在讲怎么把 RADV 从 Linux 原生搬到 Windows。出处是 Faith 的可行性研究,后续项目在 Collabora 的开发分支上,Valve 赞助了移植工作。

这条讲的是编码智能体内部,语言模型在残差流里线性编码了程序状态的几个属性:能不能 parse、过不过测试、有没有减少失败测试、有没有引入回归。

这条我读的时候是反着期待的。外面转述都往“Claude Code 留了十个孤儿 zsh 进程在后台吃 CPU”上带,好像重点是 agent 又闯祸。
这周读到 TerminalBenchScience 0.1,评估 AI 代理在真实科研工作流里表现的基准。出处是斯坦福那帮人牵头,跟全球多学科专家一起搞的。我本来只想扫一眼谁排第一,结果读到任务筛选那部分走不动了。 70 个任务,是从 920 个提案里筛出来的。接受率约 7.6%。

这条在讲一批美国政府低价卖房的数据。出处是GovAuctions.app的统计,原作者拉出了HUD、房利美、房地美三家机构的挂牌——截至2026年8月24日,一共2307套,其中367套挂牌价低于10万美元,84套低于5万美元,23套低于2.5万美元。

这条在讲 Iconimate,一个 React 动画图标库,作者 Muhammad Ammar,出处是他在 DEV Community 发的发布说明。我读到中段那句「所有图标都画在 Phosphor 256 网格上」才确认值得点——这不是又一个把 SVG 塞进 Motion 里包一层的东西。

这条在讲一个 AI 数学研究系统的案例。论文在 arXiv 上,8 月 11 日首发,14 号更到第三版。作者七个人,排前面的是 Alan Li、Rahul Saha、Anton Xue,后面跟着 Swarat Chaudhuri、Adam Klivans、Pravesh K Kothari、Raghu Meka。

这条在讲一个叫 Authority Resolution Framework(ARF)的五领域本体,目标是让 AI agent 在执行有后果的动作之前,能判定“某个人或某个角色到底有没有权干这件事”。
这篇挂在 arXiv 软件工程分类,编号 2608.16302,出处是 Gustavo da Mota 和 Kiev Gama。标题就是对比 Lovable、v0、Replit 这三个工具生成的代码结构质量。 这种「X vs Y vs Z」的对比我读过不少,大多数是拿几个截图跑跑主观分就交差。

arXiv:2608.16411,《Towards Riskfree AI Agent Deployment》,8 月 17 日提交的,作者是 Yintong Huo、Rangeet Pan 和 Abhik Roychoudhury。