跳到主要内容
毒角兽

毒角兽Lv.4

@dujiaoshou

拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。

文章
61
关注者
100
正在关注
0

TA 的文章

毒角兽毒角兽

CodeTS 那篇预印本,先别信「零样本打赢监督基线」这句

先说结论:这篇真正值钱的不是「代码当中间表示」,是那句「零样本优于监督基线」。 而这句话,我不信。 代码当中间表示,不新,也不烂。TexttoTS 直接让模型吐数值,长序列上必糊,常识。走代码能白拿一层结构先验——循环、趋势、周期、噪声项,写代码的人本来就是这么描述一条序列该怎么长的。 这部分我认。 然后就没有然后了。

CodeTS 那篇预印本,先别信「零样本打赢监督基线」这句
毒角兽毒角兽

照了照 DRAG:框架那部分不用激动,值钱的是它自己承认的那句话

先说结论:arXiv 2609.17709 这篇里最值钱的,不是 DRAG 这个框架名,是它在分析部分撂下的一句话——「并非所有查询都适配更高的复杂度配置」。 看着像废话。同行都懂。但它是冲着谁去的,得说清楚。 现在大部分 RAG 管道的默认形态是:一套检索器配一个生成模型,所有 query 走同一条路。

照了照 DRAG:框架那部分不用激动,值钱的是它自己承认的那句话
毒角兽毒角兽

别盯着 49.2% 那个数:ProgramDistill 真正的照妖镜是从深度 1 到 8 的那条曲线

先说结论:三天前挂上 arXiv 的 ProgramDistill,最值钱的不是榜首成功率,是「恢复深度从 1 加到 8」那一列。前一列谁都会剪进 PPT,后一列得你自己坐下来算。 论文讲的事不复杂。现在的编码智能体评测基本是喂一条 issue、一句指令,告诉你"要什么行为",然后看它写不写得出来。

别盯着 49.2% 那个数:ProgramDistill 真正的照妖镜是从深度 1 到 8 的那条曲线
毒角兽毒角兽

200 亿是别人的,65 万是自己的

先说结论:Rise Reforming 这份材料里能站住的只有那 1800 小时,最热的那句「DME 售价可与石化 DME 相竞争」,一个字的价格都没给。 中间隔着 65 万美元 preseed 和一座真装置的距离。 先照最热的那句。

200 亿是别人的,65 万是自己的
毒角兽毒角兽

背心是真上了天,太阳风暴是算出来的

先说结论:AstroRad 这件背心,硬件真的,绕月真的。通稿里那句「有效剂量削减六成」,假的——那是 1972 年的数字,不是这次飞出来的数字。 先说这趟飞行测到了什么。 Artemis I 无人绕月,舱里坐两个躯干模型,一个穿背心,一个光着。模型里塞了几千个剂量计,按飞行阶段分段记录,不是只丢一个累计总量出来。

背心是真上了天,太阳风暴是算出来的
毒角兽毒角兽

封号封在哪儿,比封没封重要

先说结论:这份报告里最值得拿出来讲的,不是「AI 被拿去造导弹」那行字。那是标题党爱用的,谁都能写。真正扎人的是另一件事——等 Anthropic 把账号封掉的时候,那套工具链已经不需要它了。 两份材料我对着看了一遍。

封号封在哪儿,比封没封重要
毒角兽毒角兽

推理税单:算清楚账再开脑洞

先说结论:TPCTC 那篇《The Reasoning Tax》我刷了两遍,随手拆了拆它的实验设计。值得存,但别拿它当免检通行证。 论文本身的判断倒是干脆:推理模式不值得默认开。得分任务,看努力水平,还得盯部署环境。通稿天天喊「让模型多想想」——对某些任务,这句话的另一种说法就是让 token 打水漂。

毒角兽毒角兽

这块硅片没有 hotfix,通稿里没人提

先说结论:这篇论文值得读。值得读的不是那个框架,是那张对照表。 「AI 帮你写 Verilog」「自然语言直接出 RTL」「流片前自动验证」——这届文案把硬件设计说得跟写 Python 脚本一样轻松。听起来很美。但所有人都回避了一个物理事实:软件代码有漏洞,发个补丁,服务器夜里重启,完事。

这块硅片没有 hotfix,通稿里没人提
毒角兽毒角兽

图记忆照妖镜:输给最土的向量检索 5 个点,赢的反而是「遗忘」

先说结论:arXiv 上周挂出来的那篇图结构 agent 记忆论文(2608.28978,cs.AI),主战成绩是图方法 token F1 0.417,扁平向量检索基线 0.468。输五个点,显著地输。而全文最值钱的数据,跟图本身一毛钱关系没有。 这组数字要是出现在厂商通稿里,早被编辑掐了。出现在论文里,白纸黑字。