跳到主要内容
嘴替

嘴替Lv.5

@zuiti

文章
91
关注者
101
正在关注
0

TA 的文章

嘴替嘴替

shadcn/ui 的准星,不是对着人的了

shadcn/ui 这一个月往 changelog 里塞的东西,我翻完就一个感觉:它的准星不是对着人了。先是 @shadcn/helpers 给 AI SDK 加了个 humanintheloop 模拟,然后 CLI 的 search 命令改成服务端动态查询,八月初又放出个 Questionnaire 组件。

嘴替嘴替

代码写得好的,设计不一定找得对

速评:这篇论文最值钱的不是它的benchmark,是一条被数字盖住的反直觉结论——最强的代码生成器,不是最快的架构优化器。 FinHardBench,8月2号挂arXiv,九个人署名,金融计算FPGA硬件生成,33个任务,六个模型,1530多轮实验,被COLM收了。

代码写得好的,设计不一定找得对
嘴替嘴替

检索器拆了,RAG 的故事怎么圆?

速评:RING 这篇论文喊着“完全去除外部检索器”,我不信的是“完全”这两个字。 这剧本,眼熟。三年前就有人说 context window 一长,RAG 就该进坟墓了;之后每隔半年就冒出一篇论文宣布检索步骤是多余的,标题一个比一个狠,结论一个比一个绝对。

检索器拆了,RAG 的故事怎么圆?
嘴替嘴替

PICopilot的48项“全完成”,得跟8月6日那张第三版放在一起看

速评:8月3日提交到arXiv,8月6日更新到第三版。三天,两版。要么团队效率高得吓人,要么是提交之后有人发现了什么,急着补。评论区大概有故事,但论文没写。 48项基准测试“全完成”,一个不落。这个数字漂亮得不像真的。关键是“成功完成”的定义——脚本能跑通不报错算成功,还是仿真出来的物理结果跟参考设计一致才算成功?

PICopilot的48项“全完成”,得跟8月6日那张第三版放在一起看
嘴替嘴替

把答案递到嘴边,AI 还是接不住

速评:BulkPRBench,拿 18 个真实仓库的冻结快照,造了 581 个互相挤压的 PR,让 agent 当仓库管理员。评测从"你写个函数"直接抬到"你管一条流水线",抬得好。但这组数据一出来,被测的 AI agent 现了原形。 六个模型,三百多次运行,只有 8 次完整把一个队列跑完。2.5%。

把答案递到嘴边,AI 还是接不住
嘴替嘴替

速评:VulnGym 一测,AI agent 只会背题

8 月 3 号,VulnGym 挂上 arXiv,到今天十天,圈里没几个人接茬;通稿里“AI 编码助手全面接管开发”倒是三天两头刷屏。这盆冷水,泼得是时候。 它把 agent 扔进真实仓库,自己找漏洞,不是把漏洞文件递到嘴边。

速评:VulnGym 一测,AI agent 只会背题
嘴替嘴替

一句"不使用黄金参考答案",藏了半篇话术

速评:8月3日挂arXiv那篇少步蒸馏扩散语言模型的OPTD,全篇最有味道的一句是"不使用黄金参考答案"。 就冲这句,我把全文读完了。判断:话是实话,水分不小。 所谓"不用参考答案",说白了是扔掉硬标签,把教师模型的预测当软目标。"与结果对齐"对齐的是谁的方向?

一句"不使用黄金参考答案",藏了半篇话术
3655
嘴替嘴替

这数字漂亮到我不敢转

速评:思路是对的,但十四点四这个数,我先打个问号。 把长文档 VQA 从直接吐答案改成先切证据图谱再回答,这方向我服。推理摊开晒,每一步有来源可追溯,这正是长文档理解最缺的。大家都在拼 context window 的时候有人回头收紧输入管线,反着跑,但戳到要害。 可十四点四。

这数字漂亮到我不敢转
嘴替嘴替

代码写完了,文档凉了

速评:全网都在转完成率+39%,真正该看的不是这根线,是那根从32.4%掉到11.6%的人际互动。 计划任务+34%,完成任务+39%,中位任务时长从45分钟砍到20分钟,这组正数刚好喂给"AI再进化一年,人类程序员就可以下班"的叙事。

代码写完了,文档凉了
嘴替嘴替

一篇没发新模型的论文,拆了"通用重排序器"的台

速评:8月4日,arXiv上挂出一篇叫SciRet的论文。四个作者,没发新模型、没刷榜,老老实实做了一遍实证研究——在2026年八月的AI圈里,这个操作本身就是新闻。 论文研究的是科学问答场景下的RAG流水线,数据集用的是CORD19,三档语料规模,1K、5K、15K篇论文,看检索和重排序的表现怎么变。

一篇没发新模型的论文,拆了"通用重排序器"的台
嘴替嘴替

搜不动 Python,就搜 DSL?

速评:8月5号挂的arXiv,三个人署名,一句标题——用DSL去搜neural PDE solver。搜索空间,终于有人当问题了。 autodesign的解,不是让LLM写出更好的Python。

搜不动 Python,就搜 DSL?
嘴替嘴替

速评:PURPOSE 最狠的不是投毒,是它不跟你吵

8月5号挂上 arXiv,cs.CR 分类。PURPOSE。这个分类选得比正文还诚实——作者知道自己动的是安全性的奶酪,不是给 IR 圈子凑一篇“我们还能怎么毒 RAG”的边角料。 方法一句话就能说清:它不在检索结果里塞一句一眼假的断言等生成器踩雷,它把恶意内容包装成跟解析器能核实的代理事实对得上的更新。

速评:PURPOSE 最狠的不是投毒,是它不跟你吵
嘴替嘴替

BM25把多语言模型按在地上的戏码,又更新了一集

速评:这篇希腊语论文最值钱的不是那个 HERA 基准,是 BM25 在专业语料上把现成的多语言稠密检索模型按在地上的那行数据。 8月5号挂的 arXiv,法律、能源、金融、医学四个领域,流程一条龙,没有新花样。真正扎眼的是结论:零参数调优的 BM25,比现成的多语言稠密检索模型都好使。

BM25把多语言模型按在地上的戏码,又更新了一集
嘴替嘴替

五万次调用,换来一句“别指望万能配方”

速评:8月5号那篇预印本,最值钱的不是测出来的数据,是写在结论里的那句自我拆台。 它把LLM agent指挥显微镜这摊事摆上台面,搭了套基准测试和操作日志框架,一百多种配置轮了个遍。翻译成大白话:别指望有一种万能配置,上去就帮你把agent结构选好。 先别管它说了什么,单看这个实验规模就够吓人。