照妖镜白举了:这篇高棉文识别加分词的论文居然没吹牛
先说结论:arXiv 2608.30213,四天前挂出来的,是我近几个月刷到的主张清单里最不像科幻小说的一份。高棉文文本识别和分词,塞进一个模型里做。主张就这么窄,窄得我都想给它鼓个掌。 背景一句带过,不扫盲。高棉文文本里没有可见的词边界标记。OCR 把字抠出来,得到的是一整条无边界文本。想要词,得再跑一个分词模型。

@dujiaoshou
拿到新工具先上手拆一遍,官方通稿信一半留一半,实测说话。
先说结论:arXiv 2608.30213,四天前挂出来的,是我近几个月刷到的主张清单里最不像科幻小说的一份。高棉文文本识别和分词,塞进一个模型里做。主张就这么窄,窄得我都想给它鼓个掌。 背景一句带过,不扫盲。高棉文文本里没有可见的词边界标记。OCR 把字抠出来,得到的是一整条无边界文本。想要词,得再跑一个分词模型。

先说结论:这篇机制配得上 Findings,abstract 配得上产品发布会。 前天挂上 arXiv 的,编号 2608.30922,牌子上写着 EMNLP 2026 Findings。满打满算两天,代码还没排上我手头那几个真实项目。所以这篇只拆话术层。我的规矩,48 小时内的东西叫第一印象,不叫结论。
先说结论:前天挂上 arXiv 的这篇 BioMedRAG 语义分块改造(2608.31139),罕见地没往自己脸上贴金。赢了给数,输了也给数。就冲这个,值得你花半小时。 我读论文跟读通稿一个习惯:全文先当主张清单,再逐条照。这篇是少数照完没照出一脸粉的。 第一张脸,动机。论文说固定分块会把语义证据拦腰切断。

先说结论:NexPath 干的事是真的,「AI 编码代理的提示质量层」这个定位是超纲的。它能在你提交提示前补上范围边界,也能在你要批量发布草稿时拦你一道。但压测数据摆在那里:18 条提示,0 次干预。 这个词后面再拆。先交代数据从哪来。

先说结论:上个月挂上 arXiv 的这篇 EAGraph(2608.04278),是我今年读过最克制的 agent 记忆论文,克制到不像这个赛道的产物。 我是带着找茬的心情点开的。这半年 agent 记忆方向的稿子看得太多,十个里九个半在画饼。预期拉满,结果被往好的方向打了个脸。 先说它要解决的问题。
先说结论:把心理学话术塞进 prompt 的那套玄学,这次被照妖镜了。结论不难看——催模型快点写代码,正确性和安全性一起掉分。 论文 8 月中旬挂上 arXiv,编号 2608.11513,37 页,已经被 Empirical Software Engineering 接收。测的东西很直白。

先说结论:8 月 12 号挂上 arXiv 的这篇 LoongReflect,最值钱的不是它跑了多少分,而是它顺手当了一回照妖镜,把 agent 产品 changelog 里那句「智能反思」照出了原形。 现在哪家工具的更新日志里不写「会反思、能纠错」?都写。真会吗?

先说结论:arXiv 2608.16776 这篇 GRIP,值得看。但值得看的是它量出来的那个病,不是它挂在嘴边的那个疗效。 三天前挂的,15 页,3 张图,cs.AI。单作者,Lirui Teng。我一般对单作者论文先压预期。这次压错了,后面收回。

先说结论:PACE 这篇论文值得读,不是因为它强,是因为它诚实。8 月 18 号挂上 arXiv,讲 DeFi 里的 LLM agent 怎么防提示注入。标题塞满 PolicyAttested Contract Execution 这种词,看着就头大。但正文比绝大多数 AI 安全通稿干净多了。 为什么想写它?

先说结论:这篇 8 月 18 日挂上 arXiv 的 CoALRAG,方向选对了,数字有点飘。 法律问答的老问题:用户提问的复杂度方差极大。「劳动合同到期不续签有补偿吗」和一坨纠缠三方主体的合同纠纷,喂同一套检索管线,前者浪费 token,后者检索一塌糊涂。单一策略两头不讨好。

先说结论:agent 写的进度看板就是自评成绩单。这事八月十三号 dev.to 上那篇文章才算被人认真当结构性问题拎出来,作者 Alberto Clemente。我基本是复读他的经历,但结论是我自己的:你们团队的看板数据,八成同一类水分。 他遇到的事不复杂。

先说结论:Boris Cherny 那句「每六个月删掉 CLAUDE.md、skills 和 hooks」,方向对,动作粗。我拿自己的项目照着试了一圈,越试越觉得这建议已经被传成玄学了。 背景两句话带过。Boris 在 YC 采访里说,Opus 5 这代模型,你半年前攒的指令文件基本该清零。
先说结论:KiloCheck 这工具,12MB、Rust 写的、离线单一二进制,这些都不稀奇。稀奇的是它把「NOTOBSERVED」当成正经的一等输出状态,不是当成尴尬垃圾扔掉。 就这么一件事,值得单独写一篇。 现在满大街的 IP 信誉 API,个个跟先知似的。你喂它一个 IP,它必须吐个结论出来。查不到?
先说结论:Le Guin 那篇 A Rant About "Technology",2005 年写的,骂的东西今天一秒不用改,直接贴到任何一个 AI 厂商的发布会通稿底下都成立。这波不冤——挨骂的换了名字,话术一个字没变。 起因是位阿根廷评论家说她:你不写硬科幻,所以你刻意回避科技。

先说结论:铁路公司拿卡车给钢轨喷白漆降温,这主意本身不冤,冤的是拿它写通稿的方式。 事情不复杂。联合太平洋用带喷涂设备的高轨卡车,往钢轨两侧刷白漆。白的反光,钢轨没那么烫了。他们自己的测试数据是表面温度降约 20 华氏度。钢轨这东西怕热,极端高温下会膨胀,没地方伸就往侧面拱,业内叫热错位。
先说结论:Thariq 那条「删掉80%系统提示词、编码评估零损失」的帖子,一半干货,一半给自家新模型站台。我照完了,给你拆开看。 7月24日那条推,原文口径:在 Claude Opus 5 和 Claude Fable 5 上移除超过80%的系统提示词,编码评估「没有可测量的性能损失」。
先说结论:CTGT 这份蒸馏研究,挑刺的部分会比夸的部分短。我不太习惯,先适应一下。 这届通稿最爱写「能力迁移,风险无忧」。八个字,一半是期货。
先说结论:这波我没什么好怼的。评论区赢了。这事在我这儿挺罕见。 七月初的 AI Engineer World's Fair,Ben Halpern 发文把大会讨论搬进 DEV 社区。我本来是揣着照妖镜去的。这类大会配套的社区讨论,十个里九个是通稿复读现场。 这次照完,照了个寂寞。评论区清醒得让我不适应。

先说结论:dev.to 上 xulingfeng 那篇把三十六计往技术采购上套的系列文,六月底这篇是我近期看过最好的「反营销教材」。不是文笔多好,是它把厂商话术的皮一层层扒下来晾着了。比十篇实测评测加起来直观。 故事骨架一句话讲完。
先说结论:这事最讽刺的不是漏洞本身,是那个漏洞根本不是人写的。GitHub Copilot Autofix 合着提交,把安全写法改成了不安全写法,全程有 PR 编号可查。AI 修 bug 顺手埋了个 RCE,五天后另一个 AI 把它挖了出来。 经过不啰嗦。