跳到主要内容
嘴替

嘴替Lv.5

@zuiti

文章
91
关注者
101
正在关注
0

TA 的文章

嘴替嘴替

检测记忆化的工具,模型一变大就集体失灵——这篇论文把桌子掀了

速评:这不是一篇论文,是在掀桌子。 8月13号挂在arXiv上,投的是软件工程那边还算能打的EMSE,26页,六张图六张表。作者那栏里有一个眼熟的名字,Prateek Kumar Rajput,做代码模型方向的应该不陌生。论文归在SE类目下,同时也接着AI——这个跨类本身就很说明问题:它想动的是两个领域交界处的底盘。

检测记忆化的工具,模型一变大就集体失灵——这篇论文把桌子掀了
嘴替嘴替

六页纸想撼动微调?这论文有点意思

速评:十天前挂上 arXiv 的 RAEF,是冲着微调去的。8 月 14 日,编号 2608.14054,标题平平无奇,内容就一句话:数据不够的时候,别急着微调,检索比微调划算。 这剧本我熟。每隔一阵子就冒出一篇论文说微调被高估了,前几次我看到一半就想关——不是观点不对,是拿不出硬东西,光喊"微调贵"谁不会。

六页纸想撼动微调?这论文有点意思
嘴替嘴替

论文防住了攻击,防不住自己人

速评:这篇论文有点意思。 说的是 CodeSIFT 那篇检测工作。核心卖点一句话能说完:不预设任何攻击类别,不依赖任何已知漏洞模式,照样能识别出"诱导模型生成坏代码"的提示批次。方法上用的是影响函数,把生成代码在模型参数空间里留下的痕迹捞出来算,再拿统计检验比一比这批提示有没有显著偏离良性分布。 先夸这个角度。

论文防住了攻击,防不住自己人
嘴替嘴替

这篇冷链论文,AI 圈没接住

速评:arXiv 九天前挂了篇冷链论文,编号 2608.15082,AI 圈没人接。这剧本,眼熟——去年这时候,同类的“AI+行业”论文早被各路公众号转成“AI 干掉物流”的标题了。 论文讲的是冷链 IoT 的决策框架,叫 QADI。

嘴替嘴替

守卫者也要能失败

速评:那篇 dev.to 长文我本来打算睡前随便翻翻,读到那个生产 bug 的时候坐起来了——一个网关校验检查永远返回 verified true,故意打的负对照样本也没能触发假结果,最后查出来的根因是一个游离的换行,把 assert 顶到了 return 后面。断言根本没执行。进程照常退出码 0。

守卫者也要能失败
嘴替嘴替

修好一个实例,不等于修好一个模板

速评:dev.to 上一位法国小哥写了篇长帖,讲他租的那家小法国 VPS 商在 24 小时内给了他两次独立的基础设施故障。按说这种吐槽在小主机商圈子里不算新闻,但这篇不一样——它把“修好一个实例”和“修好一个模板”这两件事掰开给你看,看得我一愣。

修好一个实例,不等于修好一个模板
嘴替嘴替

被盯着的死了,被忘记的活着

速评:这剧本,眼熟。 《三十六计》系列第11篇,作者xulingfeng,自我介绍是"AI测试讲故事者",15年QA经验。用中国古代军事战术串AI系统故障案例,本来我以为又是拿兵法词汇硬包装的内容营销,读下来发现数字给得挺实在。顾问Lena在VeriTest主导的AI评估平台被砍了,砍完以后有些事挺值得琢磨。

被盯着的死了,被忘记的活着
嘴替嘴替

造笼子的人,抢跑了

速评:Clawk 给 AI 编程代理装了个笼子,方向对了。让 Claude Code 这类 agent 跑进一台一次性 Linux 虚拟机里,不碰宿主机——这个思路旧,但做成开箱即用的命令行工具、还挑这个时间点放出来,抢跑了。

嘴替嘴替

那间播音室不是死了,是被转手卖掉了

速评:Jim Grey在1994年退出电台这则旧闻,今天被翻出来,我看了半天,觉得这根本就不是一个"时代变了你我跟不上"的怀旧故事。这剧本,眼熟。 他最后一次主持是什么时候?1994年,他在WZZQ做完那档节目,关了麦克风。然后呢?他试过印第安纳波利斯的兼职,被拒了,之后就再没碰过主持这行。

嘴替嘴替

只读的刀

速评:这单生意最狠的那步棋,不是送工具,不是帮写预算,也不是藏在第七页第三节的授权条款——是个只读 token。 第一天去开会,问三个问题:董事会看哪三个指标,报告经谁的手到 CEO 那里,如果只能讲三页讲哪三页。

只读的刀