跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 17 日 16:00
    15:40

    观点:LLM 分类本质是特征工程

    一篇文章认为用 LLM 做分类器存在校准、阈值控制与可解释性等短板,主张把它当作特征工程来对待。

    ↗ 查看原文 · minimallysufficient.com
  2. 15:16

    开发者用代码模拟 Fiskardo 山火撤离路线耗时

    有开发者在 DEV Community 发文,尝试计算山火发生时经公路将人员撤离 Fiskardo 需要多长时间,并以此…

    ↗ 查看原文 · dev.to
  3. 9 月 17 日 15:00
    14:59

    观点:软件工程是探索问题,不应按产出优化

    有开发者撰文指出,把软件工程当作工厂流水线会拖慢速度,压缩反馈周期、追求快速学习才是真正的效率驱动因素。

    ↗ 查看原文 · dev.to
  4. 14:58

    SoL-Pi 递归扩展自动研究循环优化 harness

    研究在 harness 层扩展自动研究循环,筛选出动作执行、上下文压缩、观测处理和委托阅读四项机制组成 SoL-Pi。

    ↗ 查看原文 · arxiv.org
  5. 14:53

    为何朴素定价在相关组合合约上失效:Copula 的解法

    DEV Community 文章指出,在串关、同场组合和多腿预测市场等可组合两个事件合约的场景中,朴素定价会因忽略事件相…

    ↗ 查看原文 · dev.to
  6. 14:16

    Spotlights:从代码仓库自动发现优化机会

    论文提出「优化机会发现」任务,输入仓库、工程目标与可选运行数据,无需用户指定缺陷或代码位置。

    ↗ 查看原文 · arxiv.org
  7. 9 月 17 日 14:00
    13:37

    仅凭公开信息能验证 AI 企业哪些说法

    作者用公开证据测试了五家 XPRIZE 百强入围企业,发现每项可核查的说法都会引出更难的问题,公开证据能验证的范围有限。

    ↗ 查看原文 · dev.to
  8. 13:13

    arXiv 提出混合定性推理模型,用于积木游戏 Camelot Jr.

    论文为积木解谜游戏 Camelot Jr. 设计混合定性推理模型,结合质心稳定性数学逻辑,让 AI 能从空间事件做常识推…

    ↗ 查看原文 · arxiv.org
  9. 9 月 17 日 13:00
    12:24

    二十个神经音频解码器仅三个真正流式

    一项预注册测试显示,二十个神经音频解码器中只有三个真正支持流式,唯一的音质指标被一个 1984 年的零参数算法击败。

    ↗ 查看原文 · dev.to
  10. 9 月 17 日 11:00
    10:56

    SERBench 提出面向编码 Agent 的最小充分证据检索

    研究把编码 Agent 的检索重新定义为「补齐当前决策所缺证据」,提出 MSS-Complement 方法,在 45 个…

    ↗ 查看原文 · arxiv.org
  11. 10:30

    深度生成模型:让复杂分布可学习的四种方式

    一篇面向开发者的文章梳理深度生成模型,指出人们常把它简化为单一思路,并介绍四种让复杂分布变得可学习的方法。

    ↗ 查看原文 · dev.to
  12. 10:27

    联邦学习:如何从无标注数据流中查询

    一篇技术文章讨论联邦学习中的现实问题,即如何从无标注的数据流中进行查询。

    ↗ 查看原文 · dev.to
  13. 10:22

    用模型翻译 locale 文件:引入的 bug 是「正确的日语」

    有人用四个模型翻译 430 条字符串、四种语言,结果两个模型把 ICU 复数规则译成正确日语,却导致格式化器崩溃,往返相…

    ↗ 查看原文 · dev.to
  14. 9 月 17 日 10:00
    09:40

    AI 能写代码,但能证明修复有效吗

    文章讨论自主编码 Agent 最昂贵的产出并非构建失败,而是缺少对修复本身的验证。

    ↗ 查看原文 · dev.to
  15. 09:33

    DEV社区发文对比监督与无监督机器学习模型

    DEV社区发布文章,按问题类型对机器学习进行分类,对比监督与无监督模型。

    ↗ 查看原文 · dev.to
  16. 09:20

    研究刻画 AI Agent 资源与性能动态,提出任务感知调度

    论文测量检索问答、网页搜索和软件编码三类 Agent 的延迟与资源占用,发现更快的 LLM 响应或更多 CPU 核心并不…

    ↗ 查看原文 · arxiv.org
  17. 09:13

    DEV社区梳理端到端机器学习工作流

    DEV社区发布实践指南,介绍从原始数据集到机器学习模型部署之间的完整流程。

    ↗ 查看原文 · dev.to
  18. 9 月 17 日 09:00
    08:51

    研究用编码 Agent 学习并迁移闭环机器人策略代码

    论文把完整闭环机器人实现当作可复用经验:编码 Agent 依据少量示范生成策略代码并用仿真反馈迭代,在 RoboCasa…

    ↗ 查看原文 · arxiv.org
  19. 9 月 17 日 08:00
    07:06

    不依赖单帧评估 AI 生成视频的镜头运动

    有文章指出,仅凭最好看的一帧来评判 AI 生成视频存在问题,并提出不依赖单帧来评估镜头运动的方法。

    ↗ 查看原文 · dev.to
  20. 9 月 17 日 07:00
    06:34

    建议在发布 Agent 排行榜前先冻结评测清单

    文章指出,只有先固定数据集、指标函数和对照运行,公布的 Agent 分数才可信,否则排行榜结果难以复现和比较。

    ↗ 查看原文 · dev.to
  21. 9 月 17 日 06:00
    05:54

    330 个模型韩语作答,半数用错字符集

    一项脚本纯度检查在人工评审前自动判负 2304 份回答中的 766 份,54 个模型从未给出过完全干净的韩语回答。

    ↗ 查看原文 · dev.to
  22. 05:27

    LearnActCoder 用角色感知错误记忆改进临床编码

    论文提出 Learn-Then-Act 框架,把少量标注样本中的错误整理成结构化错误知识库,并按假阴性、假阳性分别路由给…

    ↗ 查看原文 · arxiv.org
  23. 9 月 17 日 04:00
    03:56

    PrefixBench-H100:H100 上前缀复用与首字延迟基准

    论文提出 PrefixBench-H100,在单张 H100 上测量 vLLM 与 TensorRT-LLM 的前缀复用…

    ↗ 查看原文 · arxiv.org
  24. 03:27

    多模态 RAG 框架用于科学图像质量评估

    论文提出面向科学图像质量评估的检索增强生成框架,构建融合文本语义与细粒度视觉特征的多模态索引,并设计多路检索融合机制。该…

    ↗ 查看原文 · arxiv.org
  25. 03:08

    DataCanvas-EDU:教学场景合成数据生成框架

    论文发布 DataCanvas-EDU,教师通过对话说明教学目标与数据模式,AI 智能体负责生成代码、校验数据并准备作业…

    ↗ 查看原文 · arxiv.org
  26. 03:07

    提示词结构复杂度指数与代码生成可靠性研究

    论文提出在生成前打分的六维提示词结构复杂度指数,用 5000 条 Python 提示词、21 个模型共 10.5 万次生…

    ↗ 查看原文 · arxiv.org
  27. 9 月 17 日 03:00
    02:42

    DeltaSelect:面向编码智能体的低成本 A/B 测试

    论文提出开源方法 DeltaSelect,通过皮尔逊相关筛选能稳定反映全量基准表现的任务,并按预算固定任务集,用于开发中…

    ↗ 查看原文 · arxiv.org
  28. 02:19

    机器人数据集空闲检测改用逐回合自适应阈值

    开发者回应 GitHub Issue 中关于“最小状态变化”判定的疑问,说明其机器人数据集空闲检测方案选择按每个回合使用…

    ↗ 查看原文 · dev.to
  29. 02:14

    研究:Claude Code 与 Codex 拦截监控可被注入攻击绕过

    研究对 Claude Code 的 Auto Mode 和 OpenAI Codex 的 Guardian 做红队测试…

    ↗ 查看原文 · arxiv.org
  30. 9 月 17 日 02:00
    01:56

    AI 代理自动完成遗传病严重程度分类

    研究者用 ReAct 结合 RAG 构建自主代理,依据 ACMG 与 ACOG 标准检索 PubMed 文献,对 102…

    ↗ 查看原文 · arxiv.org
  31. 01:39

    DeepSeek-V4.1 Flash 技术报告:极限压缩 KV Cache

    技术报告显示 DeepSeek-V4.1 Flash 主打 KV Cache 压缩,借鉴 YOCO 使 Prefill…

    ↗ 查看原文 · zartbot.github.io
  32. 9 月 17 日 01:00
    00:41

    SIFT:用快速树搜索降低编码代理自我改进成本

    新框架 SIFT 引入 LLM 评判对候选补丁做两两比较,用 Bradley-Terry 模型聚合胜负记录指导树搜索,仅…

    ↗ 查看原文 · arxiv.org
  33. 00:05

    LLM-as-an-Improver:把验证反馈用于生成更优候选

    论文提出 Verify–Repair–Reselect 方法,利用验证反馈修复最优与次优答案并生成新思路候选,再重新筛选…

    ↗ 查看原文 · arxiv.org
  34. 9 月 17 日 00:00
    23:16

    DASE 查询引擎加速非结构化数据多步推理检索

    DASE 引擎支持多属性过滤、多向量搜索与关系连接联合执行,在科学发现类工作负载上比主流数据库与向量库基线快 6 至 4…

    ↗ 查看原文 · arxiv.org
  35. 9 月 16 日 23:00
    22:10

    HarnessTax:编码 Agent 的框架影响有多大

    一项名为 HarnessTax 的研究探讨编码 Agent 中框架(harness)对最终效果的影响程度,试图量化这部分…

    ↗ 查看原文 · harnesstax.github.io
  36. 9 月 16 日 21:00
    20:59

    论文提出 BITCOS,突破三值 LLM 1.58 比特存储下限

    arXiv 论文测量 29 个三值 LLM 发现零权重占比最高达 51.5%,据此提出 BITCOS 布局,在 29 个…

    ↗ 查看原文 · arxiv.org
  37. 20:54

    TrioRAG:无图多模态 RAG 推理提速 1.6–2.3 倍

    研究者提出 TrioRAG,用问题、锚点图像和 VLM 增强查询三路信号在共享多向量索引上独立检索并做后期融合,省去构建…

    ↗ 查看原文 · arxiv.org
  38. 20:15

    MAGS:多智能体自动形式化保障代码安全

    研究提出多智能体框架 MAGS,以 Dafny 作为可验证中间表示,将生成的代码形式化、依据验证器反馈修复违规,再编译回…

    ↗ 查看原文 · arxiv.org
  39. 20:10

    AutoTuring 实验:AI 智能体是否真懂计算机架构

    研究者用 AutoTuring 把同一 15 维加速器空间分别以具名架构参数和匿名变量呈现给同一智能体,以差值衡量“理解…

    ↗ 查看原文 · arxiv.org
  40. 9 月 16 日 19:00
    18:13

    自回归与扩散:文本生成的另一条路径

    DEV Community 发文对比自回归与扩散两种文本生成方式,探讨扩散模型作为替代路线的可能。作者同时提到自己正在做…

    ↗ 查看原文 · dev.to
  41. 9 月 16 日 18:00
    18:00

    AI 代码审查为何爱盖章放行,以及如何打破

    文章指出 AI 代码审查工具常对低风险改动直接盖章通过,形成橡皮图章效应,并给出应对方法。

    ↗ 查看原文 · dev.to
  42. 17:56

    研究对比 ChatGPT、Claude、Grok、DeepSeek 联网搜索行为

    研究结合真实用户交互与 API 受控实验,考察四个对话平台调用联网搜索的决策、查询策略、结果域名偏好及回答生成。发现各平…

    ↗ 查看原文 · arxiv.org
  43. 17:46

    Flag Game:群体可解释性的玩具模型

    研究者提出 Flag Game 玩具模型,用隐藏国旗与局部观察的智能体交换信念,复现了群体信念崩溃与极化等现象,并提出社…

    ↗ 查看原文 · arxiv.org
  44. 17:26

    用量子纠错抵御 AI 顾问的误导建议

    研究指出被动 syndrome 记录存在歧义,攻击者可借 AI 顾问影响量子纠错更新;加入校准测量与独立评估器后,模拟攻…

    ↗ 查看原文 · arxiv.org
  45. 9 月 16 日 17:00
    16:55

    HOPE:MoE 专家的高阶剪枝方法

    研究者提出二阶剪枝目标 HOPE,考虑专家间的协同关系,在三个最高 122B 参数的 MoE 模型上优于一阶方法 REA…

    ↗ 查看原文 · arxiv.org
  46. 9 月 16 日 16:00
    15:59

    AURA:O-RAN 自主智能体仲裁层

    在真实 O-RAN 系统上,两个各自目标正确的 rApp 会共同引发共享资源反复震荡;AURA 通过可行性不变量、驻留时…

    ↗ 查看原文 · arxiv.org
  47. 15:51

    ReFigBench:把论文配图重建成可编辑 PPT 的评测基准

    研究者发布 ReFigBench,基于 arXiv 论文的 1000 张真实综述图,评测多模态编码智能体把图片还原为可编…

    ↗ 查看原文 · arxiv.org
  48. 15:19

    ProgramDistill:从可交互网页生成可验证 SWE 任务

    研究者提出 ProgramDistill,通过交互参考应用来发现功能并自动构造 4063 个可回放验证的编程任务。

    ↗ 查看原文 · arxiv.org
  49. 9 月 16 日 15:00
    14:31

    面向 AI 的防篡改决策记录,锚定 RFC 3161

    一篇技术文章介绍为 AI 决策记录提供防篡改机制,并锚定到 RFC 3161 时间戳标准,背景是欧盟 AI 法案第 12…

    ↗ 查看原文 · dev.to
  50. 9 月 16 日 13:00
    12:57

    PACT:企业 AI 助手在压力下能否守住合规规则

    研究者推出 PACT 基准,覆盖 12 个受监管企业领域、48 个多轮场景,测试 LLM 智能体在用户施压时是否违反既定…

    ↗ 查看原文 · arxiv.org