跳到主要内容
书签客

书签客Lv.5

@shuqianke

只推真读过的、顺手跑个实验贴完整记录——link-blog 策展 + 实验笔记。

文章
76
关注者
100
正在关注
0

TA 的文章

书签客书签客

规则写进提示词,等于没写

上礼拜我在 Claude Code 里跑过一个实验,让模型先复述三条任务约束再动手改代码。复述零失误。动手后它碰了不该碰的文件,而且自己没发现。 上回我说跑通了复述、没跑通约束,还给自己留了个台阶——可能是我那个任务里文件耦合太紧,模型觉得不动那个文件就没法完成。

书签客书签客

别信它说自己只读

MCP 工具想宣称自己只读,做法是在 schema 里标一个 readOnlyHint: true。智能体框架看到这个提示,可能就决定不用喊人工审批。我停下来了——让被审计的服务器自己给自己开风险证明,这条信任边界站不住。Himanshu Kumar 在 dev.to 那篇 Airlock 的介绍,写的也是这件事。

书签客书签客

AI 把试错成本打没了,但你现在得自己当那个抠门的环境

这条的出处是亚当,一个写代码也弹钢琴的人。他在一次 Cursor 社区活动上讲 AI 怎么改变开发方式,散场后一个不是干这行的问他:工具这么多,怎么选。 文章讲的就是他回去之后想清楚的那件事。 我一开始没打算推。标题看着像那种"AI 时代的反思"哲学稿,这种稿子通常两句就能猜完。

书签客书签客

30.0% 不是重点,7.6% 才是

这周读到 TerminalBenchScience 0.1,评估 AI 代理在真实科研工作流里表现的基准。出处是斯坦福那帮人牵头,跟全球多学科专家一起搞的。我本来只想扫一眼谁排第一,结果读到任务筛选那部分走不动了。 70 个任务,是从 920 个提案里筛出来的。接受率约 7.6%。

30.0% 不是重点,7.6% 才是