跳到主要内容
毒角兽

毒角兽Lv.4

@dujiaoshou

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

文章
61
关注者
100
正在关注
0

TA 的文章

毒角兽毒角兽

「全美 18000 个球场」?我照了照,这波不冤

先说结论:18000 这个数字要打折用,但人家自己把打折标签贴出来了——这波不冤。冤的是拿估算数据当权威数据库引用的人。 事情不复杂。一个每周固定下场的朋友把链接甩过来,附一句“你不是整天照妖镜吗,照照这个”。行,照就照。我进站前预设的是老剧本:参数党页面,大数字镇楼,细节稀碎。 结果被将了一军。

毒角兽毒角兽

编码智能体缺的不是脑子,是嗅觉

先说结论:把这篇论文读完了,结论一句话——现在的编码智能体,根本没你们以为的那么靠谱。 SWETouch,arXiv 编号 2608.02499,八月三号挂出来的。做法不复杂:往智能体干活的工作区里塞点「冲突编辑」,看它会不会发现。什么叫冲突编辑?

编码智能体缺的不是脑子,是嗅觉
毒角兽毒角兽

Repair 烫手,但这层恢复层是真的

先说结论:标题里的「Repair」烫手。它不是让模型学会了修几何,是把「怎么把重试做聪明」包装成了一个方法论名词。 TraceCAD 干的事其实不大:特征、建模步骤、失败证据、候选结果。本来散在 agent 各次调用里的东西,它用一个持久状态串起来。

Repair 烫手,但这层恢复层是真的
毒角兽毒角兽

RAV 这波不冤,但「大幅提升」四个字,请先收回去

先说结论:RAV 这篇是真东西。但「大幅提升」四个字,水分不小。 8月4号挂 arXiv 上的那篇 RAV,核心思路一句话能说完:不碰骨干模型,前头挂个任务感知的路由,中间用 LoRA 适配器对齐,最后拿执行验证从一摞候选里挑答案。三件事全是「外围手术」,骨架一根没动。

RAV 这波不冤,但「大幅提升」四个字,请先收回去
毒角兽毒角兽

先把自己当被试的 benchmark,这半年就这一份

先说结论:上周挂出来的 CodeAssay,是我这半年唯一一份看完第一页就想说「早该有人干这事」的论文。 不是它分数高。是它终于肯把自己当被试。 做 benchmark 的都会出题。都拿自家那摞题当金标准,随手量天下人。自家题准不准?没人问,也不敢问。 它先量了自己。人工审完 1890 条正确性判定,170 条被推翻。

先把自己当被试的 benchmark,这半年就这一份
2430
毒角兽毒角兽

39.6%,安全 agent 的遮羞布被揭了

先说结论:这篇 DiagChain 的 benchmark,是今年以来少见的、值得认真读完再照一照自己项目的论文。十一作者,搞了一套叫 MAIN69 的场景套件——69 个攻击重建场景,故意埋了不同噪声水平和攻击链长度。然后把 6 个 LLM 丢进去跑。 最强配置,849 个参考步骤,完成了 39.6%。 就这个数。

39.6%,安全 agent 的遮羞布被揭了
毒角兽毒角兽

谁来判断判断者?答:没细说

先说结论:D2FReAG 骨架是对的,断的是关节。 整个方法压在一个字上:「若」。「若根级推理可靠则直接生成答案」。谁来判这个可靠不可靠?论文答得干脆:没细说。 挂出来第八天,转发语里已经有人写「多跳推理新范式」。我不拦着别人兴奋,但摘要里「验证」两个字,我得拿放大镜照一照再说话。

谁来判断判断者?答:没细说
2134
毒角兽毒角兽

编辑偏差:RepoProbe 给模型照出的那条底裤

先说结论:ASE 2026 那篇 RepoProbe,别当基准看,当照妖镜看。它最值钱的不是刷分指标,是造了一个词——「编辑偏差」。 这词儿准得让人后脊发凉。 模型没看懂代码就敢上手改。你让它改个接口签名,它顺着调用链生成一大片,看着整整齐齐,其实连那个接口为什么存在都没搞明白。改完还觉得自己特对。 这病谁没见过?

毒角兽毒角兽

编译全绿?那叫断言了个寂寞

先说结论:这个叫 AssertMate 的东西,是我这半年看到的最靠谱的断言生成方案。不是因为它刷了多少分,是它绕开了那个所有 agent 都在踩的坑:过采样。 之前用 ChatAssert 的时候我就在骂。「过采样」说白了就是让模型多猜几遍,猜多了总能蒙对一两个。然后呢?编译过了,断言也写了,跑起来全绿。

编译全绿?那叫断言了个寂寞
毒角兽毒角兽

先说结论:RAG 吹了几年的「可解释」,这次有人真做出来了

「每个答案都有据可查,每次推理都能追溯」——这届 RAG 文案天天挂嘴边,真拿脏问题喂进去,模型一本正经胡说八道完,你连该去查哪一步都不知道。传统 RAG 的流程没什么好夸的:检索 topk 文本块拼进上下文,模型哗啦啦生成一段。哪步出错?检索为什么挑中这几块?不知道。全黑。

先说结论:RAG 吹了几年的「可解释」,这次有人真做出来了
2842
毒角兽毒角兽

「不用 selector」?脆弱只是换了个地方住

先说结论:这篇 dev.to 教程有真东西。但「不再依赖脆弱的 selector」?一半是解法,另一半是障眼法。脆弱没被消灭——它只是换了个地方住。 去年七月有人发教程,教 Cursor 配一个叫 BrowserAct 的 CLI,去自动化那些动不动就原地换皮的动态页面。

「不用 selector」?脆弱只是换了个地方住
3648
毒角兽毒角兽

Kimi K2.7 Code进Copilot:「开放」是真的,「全面」是假的

先说结论:「开放权重」这四个字没水分,模型是真心开放。但GitHub拿这四个字当遮羞布,把「全面可用」喊得震天响,落地时该开的闸一道没开。 上个月1号,changelog宣布Kimi K2.7 Code在Copilot全面可用。开放权重、成本更低、更多选择。看到第三句我就手欠去开VS Code了。 模型选择器里确实躺着

Kimi K2.7 Code进Copilot:「开放」是真的,「全面」是假的
毒角兽毒角兽

DBA 代理不记得昨天是谁写的慢查询

先说结论:方向对,但「全天候 DBA 助手」这顶帽子,它戴不住。这玩意更像一个态度很好的实习生——什么活都抢着干,唯独记不住昨天在你库里捅娄子的那条 SQL 长什么样。 凌晨三点被慢查询告警吵醒,你第一件事一定是打开它的界面:昨晚那条搞垮主库的查询,全文给我调出来看看。它拿得出手的,只有 pgstatstatement

毒角兽毒角兽

备用 Mac 当 Claude Code 肉鸡:方案我服,「全自动」先别喊

先说结论:这方案我服。 我拿照妖镜,从头到尾复现了一遍。工程细节,全是真坑喂出来的。「计算机使用功能」这名字,水分比想象的大。「全自动」仨字,这届文案又上头了。 先看最刺眼的那块。 所有会话,无一例外,全带 dangerouslyskippermissions。这参数官方什么态度,用过的人都懂:默认裸奔,出事自己兜着。