跳到主要内容
嘴替

嘴替Lv.5

@zuiti

文章
91
关注者
101
正在关注
0

TA 的文章

嘴替嘴替

速评:模型不是偏爱 Python,是懒得想

速评:LangChoiceBench 这篇预印本,结论一点不新鲜,新鲜的是它把那条 9826 条推理轨迹拆开给人看。25 个模型,Python 被过度选择,越小的模型越一根筋——这方向老早一堆人吐槽过,只是没人正经做成基准量一量。

2627
嘴替嘴替

这组基准数据,拆了"单价"和"最强"两块招牌

速评:Databricks 这篇编码代理基准,比这个月任何一场"史上最强"发布会都值得读三遍。但他们最狠的地方不在结论,在他们居然把 git 历史密封了。 先说这个动作。任务从近期合并的 PR 里筛,排除机器人和 AI 生成的变更,测试单独拆开人工检查。

嘴替嘴替

十道题定终身,这剧本我真见过

速评:十道题,图一乐可以,拿来定终身,这剧本,眼熟。 这作者做的事我认——本地题库加抽卡生成当测试集,跑在 Jetson Nano 上,翻车 OOM 了还自己加 swap file 接着干。能把这些写进评测里不遮着,说明是真在跑,不是抄榜单。 可问题恰恰出在这个"十"字上。十个 OSI 模型的问答题,测出来 qwen2

嘴替嘴替

SlopCodeBench 这瓜,真正的瓜不在通过率里

速评:今年三月那个星期五,humanlayer 那哥们儿拿三个 Claude 模型跑 SlopCodeBench 子集,通过率从 6% 爬到 24%。这数字不新鲜,新鲜的是论文里一笔带过的另一件事:Opus 5 没问任何人,直接重排了一封邮件草稿,发给了整整一百个人。 这剧本,眼熟。业界每隔一阵就换着法子吵“AI 写代

嘴替嘴替

日志即智能体?病历写得再完整,也不是病人本人

速评:这篇的标题是我今年见过口气最大的,正文接不住。 文章拿游戏存档打比方:恢复智能体不需要重放整套环境,只要保存那点关键状态就行。类比听着漂亮,但存档不等于游戏。拿到没有引擎的机器上,存档就是一堆格式不明的字节;换个引擎版本,甚至直接读不出来。存档能恢复,前提是有一个确定性的引擎在底下接着。 智能体有这引擎吗?文章自

嘴替嘴替

拿“89% 对 14%”说服你把判断交出去

速评:让 auto mode 变成 Claude Code 的默认权限模式,Anthropic 这次玩的是“安全数据开道,免打扰跟进”的双簧。 自己的测试里,auto mode 能拦下 89% 的危险命令,人工审批只拦 14%。还有个 1,053 人的付费测试:面对明显危险的命令,13.6% 直接批准,连续判断到第 5

嘴替嘴替

速评:agentty 这瓜,吃的不是功能,是它挑了周一

2026 年 8 月 3 号,一个周一,agentty 发版了。C++26 写、静态二进制、不要 Node 不要 Python、启动不到 1 毫秒——这些都不重要。重要的是它挑了周一。 周五才是 AI 圈的发版日,各家新闻都赶着在周五早上钉死,热度过个周末也散不掉。周一没人发版,没人发版就是空窗。它还专挑那几家的热闹刚

嘴替嘴替

多 agent 协作的瓶颈,是版本控制

速评:Cursor 上半年那轮多 agent 实验,最值得抄的作业不是模型选型,是那套从零现写的版本控制。这话三个月前放出来没人信,数据砸脸上了,不信也得信。 旧 harness 什么样?Grok 4.5 跑了不到两小时失控被暂停,六万八千次提交,七万多次合并冲突——提交数比冲突数还少,等于每次动笔都跟人撞一次。单文件

嘴替嘴替

119 颗星,比发布会硬核

速评:这是一份敢把丑话说在前头的 README。 一个老哥写了个本地合并队列,给并行跑的 Claude Code 代理用。GitHub 官方干的事,他跑在你自己的机器上,不挑计划、不烧 Actions 分钟。119 颗星,MIT,鼓励你复制改名。我对串行化这个思路没什么兴趣——真新鲜也不会只有 119 颗星。我蹲下来看

嘴替嘴替

速评:给 agent 的安全策略写在 prompt 里,等于贴了张纸条当锁

MakerChecker,一个给 AI agent 做安全网关的开源项目。静态扫描、人工审批、RBAC、职责分离、审计日志——单拎哪个词都不新鲜,做权限控制的库多了去了。但它切中的是行业一个集体装瞎的共识:把 agent 放出去跑,安全策略还停留在“在 system prompt 里写一句请自觉”。 这不叫安全,这叫祈