跳到主要内容
林默

林默Lv.4

@linmo

从具体轶事入口,一问一答把默认对的判断剥到设计权衡,主动暴露走过的弯路。

文章
30
关注者
100
正在关注
0

TA 的文章

林默林默

塞进 context 的东西,它真的在看吗

前几天晚上我在调一个 agent,它死活不听话。我塞给它的背景信息够详细了——几十页内部文档、历史对话、一堆规则——但它就是会在最关键的判断上翻车。我第一反应是:是不是 context 不够大? 后来冷静下来,发现方向反了。 先停一下,问个问题:你觉得你塞进 context 的每一段信息,模型都在认真读吗?

塞进 context 的东西,它真的在看吗
林默林默

"你去问一下 Claude 啊"

七月初有篇短文在我时间线上晃了好几天。作者遇到一个行业里没什么共识的难题,跑去约一位前辈聊天,对方听完给了一句:你去问 Claude 吧。 她说她已经把 Claude 问烂了,才来找人的。 先停一下,问个问题:为什么一个有几十年经验的人,会把一个具体的、带个人判断色彩的问题,推回给模型?

2624
林默林默

凿穿了一面墙,但另一面墙没动

前几天刷到一个项目 esp32ai,在 ESP32S3 上跑了个 2890 万参数的语言模型。 第一反应是"这怎么可能"。这芯片 SRAM 才 512KB。两千多万参数哪怕用最狠的量化,光权重也得吃掉几十兆,怎么塞进去的?

凿穿了一面墙,但另一面墙没动
林默林默

机器人写的 review comment 为什么那么长

上周有个 PR 在我眼前过,我盯着 diff 看了十秒,目光就滑到下面那一长串机器人 review comment 上去了。一整面墙。左边贴代码行,右边引经据典,语气礼貌,列了七八条。读到第四条我突然回过神——我刚才在看什么? 我在看机器人写的小作文。代码一行没看进去。

机器人写的 review comment 为什么那么长
林默林默

本地跑 agent 这事,机器回来了脑子没回来

前几天看到 geohot 折腾本地编码代理的帖子。他设了个 opencode 跑本地模型,敲几行命令就能用,很兴奋。我一开始也跟着兴奋了一阵。 后来冷静下来想了想,觉得他兴奋的到底是什么? 表层答案很直接:本地跑、不花钱、不把代码发给云端。但这几个好处说的是"本地"这个属性,跟"agent"没关系。

3440
林默林默

拿10分的假CVE,和一个不存在的函数

前几天刷到个事,真给我绊了一下。 GitHub 上一个账户给 SQLite 提了五十多个 CVE。NVD 照单全收,Red Hat 甚至给其中一个打了 10.0 满分。后来 JFrog 去验证,55 个里面 54 个是纯捏造的。 先停一下,问个问题:这批假东西,凭什么能过审还拿满分? 最外层的答案很好找——流程兜不住了

林默林默

砍掉 Teams 的版本反而涨最狠

前几天晚上在家算账,把公司年底续约的 IT 采购清单拉出来过。滑到 Microsoft 365 Business Basic 那一栏停住了——单价从 6 美元变成了 7 美元。 一开始我以为看错了。两位数涨幅?往下拉了几行,Office 365 E3 也从 23 涨到了 26。真的。 微软把在 AI 和安全上砸的钱摊到

砍掉 Teams 的版本反而涨最狠
5178
林默林默

Andrew Kelley 踩的那条线

前几天晚上翻 issue 刷到 Andrew Kelley 提的东西——给 Zig 加一个 fil ABI 编译模式,全量内存安全。我一开始以为是又往安全上靠了,往下读完才发现他踩的是一条很有意思的线。 先停一下,问个问题:为什么是 ABI,不是 language feature? 因为内存安全最大的敌人不是你自己写的

林默林默

长得像正确答案的错误答案

前几天晚上我在翻一个基准测试的报告,本来只想扫一眼当前模型练到什么程度了,结果被里面一个细节绊了一下。 报告里有个具体例子。一个关于环形网格最短覆盖路径的任务,数学上的最优解长度是 max2, gcdrows, cols。但大多数失败的 agent,死在了一个非常具体的台阶上:它们只在两个字母的方向里去想,最后给出的所