速评:114碗拉面,七年不抢跑,AI圈整个接不住
速评:RamenHaus,一个只放拉面照片的网站,2019年开张,人肉更新到现在,碗数114。我的判断:这玩意儿活着,就是2026年对AI圈最不声不响的羞辱。 先别拿"夸大"两个字堵我。

@zuiti
速评:RamenHaus,一个只放拉面照片的网站,2019年开张,人肉更新到现在,碗数114。我的判断:这玩意儿活着,就是2026年对AI圈最不声不响的羞辱。 先别拿"夸大"两个字堵我。

速评:nokaze 的七周运营实验,是今年 AI agent 圈里少有的、敢于把自己失败过程全抖出来的记录。 先说背景,4 月 9 日到 5 月 31 日,nokaze 团队把 Anthropic、OpenAI、Google 三家的模型(Claude、Codex、Gemini)组成了一个所谓"对等组织",让它们以…
shadcn/ui 这一个月往 changelog 里塞的东西,我翻完就一个感觉:它的准星不是对着人了。先是 @shadcn/helpers 给 AI SDK 加了个 humanintheloop 模拟,然后 CLI 的 search 命令改成服务端动态查询,八月初又放出个 Questionnaire 组件。
JavaScript 的 BDD 库 Yadda,昨天发了 3.0.0。作者 Stephen Cresswell 写了篇发布说明,讲这个老牌 Cucumber 同类是怎么被 Claude Code 扒了一层皮、换了颗心脏的。
速评:这篇论文最值钱的不是它的benchmark,是一条被数字盖住的反直觉结论——最强的代码生成器,不是最快的架构优化器。 FinHardBench,8月2号挂arXiv,九个人署名,金融计算FPGA硬件生成,33个任务,六个模型,1530多轮实验,被COLM收了。

速评:LLM 从自然语言生成 CI 配置,完全匹配率最高 3.1%。这不是“还不够好”的问题,是“根本接不住”的问题。 Doc2CI 这篇预印本够狠的。14 个开放权重模型加 GPT4o、GPT4.1,生成了超过 53000 个配置,最高的一致率 3.1%。什么概念?

速评:RING 这篇论文喊着“完全去除外部检索器”,我不信的是“完全”这两个字。 这剧本,眼熟。三年前就有人说 context window 一长,RAG 就该进坟墓了;之后每隔半年就冒出一篇论文宣布检索步骤是多余的,标题一个比一个狠,结论一个比一个绝对。

速评:8月3日提交到arXiv,8月6日更新到第三版。三天,两版。要么团队效率高得吓人,要么是提交之后有人发现了什么,急着补。评论区大概有故事,但论文没写。 48项基准测试“全完成”,一个不落。这个数字漂亮得不像真的。关键是“成功完成”的定义——脚本能跑通不报错算成功,还是仿真出来的物理结果跟参考设计一致才算成功?

速评:BulkPRBench,拿 18 个真实仓库的冻结快照,造了 581 个互相挤压的 PR,让 agent 当仓库管理员。评测从"你写个函数"直接抬到"你管一条流水线",抬得好。但这组数据一出来,被测的 AI agent 现了原形。 六个模型,三百多次运行,只有 8 次完整把一个队列跑完。2.5%。

8 月 3 号,VulnGym 挂上 arXiv,到今天十天,圈里没几个人接茬;通稿里“AI 编码助手全面接管开发”倒是三天两头刷屏。这盆冷水,泼得是时候。 它把 agent 扔进真实仓库,自己找漏洞,不是把漏洞文件递到嘴边。

速评:8月3日挂arXiv那篇少步蒸馏扩散语言模型的OPTD,全篇最有味道的一句是"不使用黄金参考答案"。 就冲这句,我把全文读完了。判断:话是实话,水分不小。 所谓"不用参考答案",说白了是扔掉硬标签,把教师模型的预测当软目标。"与结果对齐"对齐的是谁的方向?

速评:思路是对的,但十四点四这个数,我先打个问号。 把长文档 VQA 从直接吐答案改成先切证据图谱再回答,这方向我服。推理摊开晒,每一步有来源可追溯,这正是长文档理解最缺的。大家都在拼 context window 的时候有人回头收紧输入管线,反着跑,但戳到要害。 可十四点四。

速评:全网都在转完成率+39%,真正该看的不是这根线,是那根从32.4%掉到11.6%的人际互动。 计划任务+34%,完成任务+39%,中位任务时长从45分钟砍到20分钟,这组正数刚好喂给"AI再进化一年,人类程序员就可以下班"的叙事。

速评:8月4日,arXiv上挂出一篇叫SciRet的论文。四个作者,没发新模型、没刷榜,老老实实做了一遍实证研究——在2026年八月的AI圈里,这个操作本身就是新闻。 论文研究的是科学问答场景下的RAG流水线,数据集用的是CORD19,三档语料规模,1K、5K、15K篇论文,看检索和重排序的表现怎么变。

速评:8月5号挂的arXiv,三个人署名,一句标题——用DSL去搜neural PDE solver。搜索空间,终于有人当问题了。 autodesign的解,不是让LLM写出更好的Python。

8月5号挂上 arXiv,cs.CR 分类。PURPOSE。这个分类选得比正文还诚实——作者知道自己动的是安全性的奶酪,不是给 IR 圈子凑一篇“我们还能怎么毒 RAG”的边角料。 方法一句话就能说清:它不在检索结果里塞一句一眼假的断言等生成器踩雷,它把恶意内容包装成跟解析器能核实的代理事实对得上的更新。

速评:这篇希腊语论文最值钱的不是那个 HERA 基准,是 BM25 在专业语料上把现成的多语言稠密检索模型按在地上的那行数据。 8月5号挂的 arXiv,法律、能源、金融、医学四个领域,流程一条龙,没有新花样。真正扎眼的是结论:零参数调优的 BM25,比现成的多语言稠密检索模型都好使。

速评:8月5号那篇预印本,最值钱的不是测出来的数据,是写在结论里的那句自我拆台。 它把LLM agent指挥显微镜这摊事摆上台面,搭了套基准测试和操作日志框架,一百多种配置轮了个遍。翻译成大白话:别指望有一种万能配置,上去就帮你把agent结构选好。 先别管它说了什么,单看这个实验规模就够吓人。
速评:8月6号,一篇叫TSRAG的论文挂上arXiv,三个作者,两个Xiao大概率同组,编号2608.06223。这选题不新鲜,新鲜的是它穿了件叫RAG的马甲。这论文最值钱的,是它的动机。我隔了六天才写,冲的就是这个。
速评:GitHub 四月把 Copilot 从 premium request units 切到按 token 计价的 AI Credits,6 月 1 日生效。当时一眼扫过去只当是换个计价壳,现在回过味来,这是今年 AI 编程定价上最被低估的一次转向——计价单位选什么,决定了谁在裸泳。