跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 9 日 23:00
    22:18

    A2ABreak:首个 A2A 协议系统性安全分析,发现 11 个新漏洞

    论文提出 A2ABreak,从 A2A 协议自然语言规范中提取出含 37 个状态、76 个转换的有限状态机,据此发现 1…

    ↗ 查看原文 · arxiv.org
  2. 9 月 9 日 19:00
    18:18

    研究:任务完成不等于可靠,智能体在累积挑战下更依赖人类

    研究用 120 条模拟医疗轨迹测试两个生成式 AI 模型,发现随挑战累积,智能体从自主恢复转向依赖人类,结构化报告中工作…

    ↗ 查看原文 · arxiv.org
  3. 9 月 9 日 18:00
    17:59

    IdeaAMBIG 基准发布:评测研究想法的可实现性缺口

    arXiv 论文提出 IdeaAMBIG 基准,含 660 个实例,用于评估论文方法描述是否足以被实现者或编码智能体复现…

    ↗ 查看原文 · arxiv.org
  4. 17:52

    规模胜过巧思:苦涩教训的思考

    作者阅读 Rich Sutton 的《苦涩的教训》后,探讨了规模在 AI 发展中超越复杂算法设计的核心观点,并引发持续思…

    ↗ 查看原文 · dev.to
  5. 17:24

    Qwen 3.8 复现 GPT-5.5 Pro 推理预填充实验

    开发者用 GPT-5.5 Pro 作为教师,对 Qwen 3.8 等开源模型进行推理预填充实验,验证其效果。

    ↗ 查看原文 · gist.github.com
  6. 17:18

    AI解决千年难题,作者认知被颠覆

    作者称AI系统可能首次解决了此前无人能解的千年难题,这标志着AI从模仿人类转向创造新知识,彻底改变了他对AI能力的看法。

    ↗ 查看原文 · rough-ideas.bearblog.dev
  7. 17:13

    Procedural Graphs:LLM Agent 自进化执行结构

    Google 等机构提出 Procedural Graph,以三元组形式存储操作步骤,供 Agent 查询。

    ↗ 查看原文 · academy.dair.ai
  8. 9 月 9 日 17:00
    16:33

    TrajMark:为编码智能体轨迹做归属与篡改定位水印

    arXiv 论文提出 TrajMark,一种无需训练、对称密钥的轨迹水印框架,将归属认证与局部完整性校验分离。

    ↗ 查看原文 · arxiv.org
  9. 16:18

    EXCODER:用 LLM 为现有代码补全异常处理代码

    arXiv 论文提出用 LLM 为缺少异常处理代码的现有代码自动补全 throw、try/catch 等结构,使其通过给…

    ↗ 查看原文 · arxiv.org
  10. 9 月 9 日 15:00
    14:53

    KVShareArena 基准测试跨上下文与检查点的 KV 缓存复用

    现有 KV 缓存复用只支持提示词前缀完全一致的情况。该基准覆盖检索片段与多智能体报告场景,按相对完整重算的差距恢复比例评…

    ↗ 查看原文 · arxiv.org
  11. 14:36

    A-JIT:用内嵌智能体实现即时软件构建

    研究者提出 Agentic Just-In-Time Software Construction 范式,把静态二进制替换…

    ↗ 查看原文 · arxiv.org
  12. 14:32

    LiteRAG:低成本图检索增强生成方法

    LiteRAG 用查询条件驱动的算法探索和推理链上下文构建替代检索阶段的 LLM 控制。

    ↗ 查看原文 · arxiv.org
  13. 14:31

    研究:知识图谱问答中答案路径与接地指令的影响

    作者在 6 个模型和 2 个知识图谱问答基准上变换提示词的四项选择,发现答案路径是否在提示词中、以及接地指令是仅有的两个…

    ↗ 查看原文 · arxiv.org
  14. 14:23

    Φ-Bench:评测大模型能否工程化自身基础设施

    现有基准多聚焦孤立算子或预设优化目标,Φ-Bench 基于前沿研究问题与真实代码库,覆盖从内核级函数补全到长周期系统优化…

    ↗ 查看原文 · arxiv.org
  15. 9 月 9 日 14:00
    13:51

    arXiv 论文提出 EvidenceNet 运行时保障层

    论文针对多智能体跨权限域网络自动化中难以验证全网结果的问题,提出 EvidenceNet 运行时保障层,通过 broke…

    ↗ 查看原文 · arxiv.org
  16. 13:32

    研究用 DoRA 将个人语料写入小模型权重

    论文将 515 名参与者的个人文本语料通过 DoRA 微调写入小语言模型权重,适配器对本人留出文本的拟合优于他人文本。

    ↗ 查看原文 · arxiv.org
  17. 9 月 9 日 11:00
    10:14

    CrossCoder 跨仓库图检索提升代码生成

    论文提出跨仓库代码生成框架 CrossCoder,通过统一知识图将外部库纳入检索上下文,并选择性扩展多跳邻居节点。

    ↗ 查看原文 · arxiv.org
  18. 10:10

    论文提出强化学习最优价值的离线推断方法

    论文研究强化学习中最优价值的离线推断,通过自诱导贝尔曼方程推导两个新干扰项,并基于 Neyman 正交性提出去偏估计量…

    ↗ 查看原文 · arxiv.org
  19. 9 月 9 日 09:00
    08:56

    研究发现语言模型自我描述缺乏特异性

    论文在九项行为评估中发现,模型对自身行为的预测与通用 AI 智能体预测效果相当,直接自报相关性仅 +0.04。

    ↗ 查看原文 · arxiv.org
  20. 08:16

    CGMIA:用成员推断攻击检测代码生成基准数据泄漏

    研究者提出 CGMIA,通过影子模型构建成员与非成员样本,结合 CodeBLEU、编辑距离、测试通过率、困惑度及 Cod…

    ↗ 查看原文 · arxiv.org
  21. 9 月 9 日 08:00
    07:58

    NetArtifactBench:测试 AI Agent 能否修复网络实验记录漂移

    该基准包含 52 个注入不一致的实例,考察 Agent 在修复记录矛盾的同时保留有证据支持的结论。

    ↗ 查看原文 · arxiv.org
  22. 9 月 9 日 07:00
    06:41

    Pairit:支持人机协作实时实验的在线平台

    研究者推出 Pairit,用户通过单个 YAML 配置文件声明实验图,包括页面、随机化、匹配、聊天、共享工作区、服务端…

    ↗ 查看原文 · arxiv.org
  23. 06:16

    XAgent:执行引导的智能体框架提升 GitHub 问题修复率

    论文提出 XAgent,通过分析程序动态行为与额外上下文来定位和验证 GitHub 问题,在 SWE-bench-lit…

    ↗ 查看原文 · arxiv.org
  24. 06:12

    微调结合 KV 缓存重算,长上下文 RAG 精度与首字延迟双改善

    研究提出在微调时考虑 KV 缓存拼接,并有选择地重算部分缓存。在 RULER 基准 124k token 输入下,得分比…

    ↗ 查看原文 · arxiv.org
  25. 9 月 9 日 02:00
    01:33

    Phoenix V2 发布:AI 认知架构可记忆、情感与进化

    Phoenix V2 作为 AI 认知架构发布,包含论文、代码和书籍。该架构旨在解决 AI 模型更新后丢失先前构建内容的…

    ↗ 查看原文 · dev.to
  26. 9 月 9 日 01:00
    00:49

    jaROTE:用发布日期补全日语新闻中省略的时间表达

    研究提出规则化流程 jaROTE,在索引前依据发布日期将日语新闻中省略的时间表达还原为具体日期或区间,实验显示其性能高且…

    ↗ 查看原文 · arxiv.org
  27. 00:33

    研究评估 Vibe Coding:效率提升但可维护性与安全性下降

    一项 30 人混合方法研究显示,Vibe Coding 相比传统编程缩短任务完成时间 27%,但可维护性指标更低、安全漏…

    ↗ 查看原文 · arxiv.org
  28. 9 月 9 日 00:00
    23:55

    OpenAI 未发布模型攻克 Navier-Stokes 千禧年难题

    OpenAI 用一款未发布模型给出了 Navier-Stokes 存在性与光滑性问题的解答,该问题属七个千禧年大奖难题之…

    ↗ 查看原文 · simonwillison.net
  29. 9 月 8 日 19:00
    18:55

    研究:LLM 对输入数据的可信度感知对错误率影响有限

    研究用英语、捷克语、斯洛伐克语和上索布语从事实、反事实与虚构 RDF 三元组生成文本,发现人工标注样本中上下文与记忆的冲…

    ↗ 查看原文 · arxiv.org
  30. 18:04

    传统测试准则难检出LLM生成代码缺陷

    一项涉及5个LLM和4个基准的实证研究发现,语句覆盖、分支覆盖和变异测试对LLM生成代码的缺陷检出率极低,常接近零,测试…

    ↗ 查看原文 · arxiv.org
  31. 9 月 8 日 16:00
    15:04

    生产级LLM流水线:确定性代码钩子优于Agent自我纠错

    一篇技术文章讨论生产环境LLM流水线中的熔断器模式,认为确定性的代码钩子比让Agent自我纠错更可靠。

    ↗ 查看原文 · dev.to
  32. 9 月 8 日 15:00
    14:53

    自进化代理框架缩小LLM一致性差距

    研究发现LLM代理在重复任务中表现不稳定,存在一致性差距。新框架通过分析不稳定步骤并生成指南,将多次运行成功率提升16个…

    ↗ 查看原文 · arxiv.org
  33. 14:23

    Hugging Face 论文:按部署策略细分拒绝话题子集

    Hugging Face 团队发表论文,研究安全对齐中按话题整体拒绝的局限,提出边界感知自蒸馏方法,使模型能根据部署策略…

    ↗ 查看原文 · huggingface.co
  34. 9 月 8 日 14:00
    13:58

    果蝇电路模型预测语音情感

    研究用固定499神经元果蝇电路预测语音情感标签,但打乱线路后效果相同,表明该控制实验至关重要。

    ↗ 查看原文 · dev.to
  35. 9 月 8 日 11:00
    10:29

    损失函数真相:MSE、交叉熵与softmax陷阱

    文章解释了MSE和交叉熵等损失函数实际向模型传递的信息,并提及了一个即使存在bug仍能训练的softmax问题。

    ↗ 查看原文 · dev.to
  36. 9 月 8 日 10:00
    10:00

    OpenAI 发布 Navier-Stokes 千禧年问题 AI 解法

    OpenAI 分享了一个 AI 生成的 Navier-Stokes 千禧年大奖难题的解决方案,包括论文和 Lean 形式…

    ↗ 查看原文 · openai.com
  37. 09:49

    论文提出智能最小预测假说

    一篇论文提出将状态转移预测与语言相联系的智能最小假说,试图从物理结构角度解释智能本质。

    ↗ 查看原文 · dev.to
  38. 09:36

    留一法消融:识别真正重要的 AI 代理

    现代 AI 系统常由多个代理组成,如欺诈检测场景。留一法消融方法可评估各代理的实际贡献,帮助识别关键组件。

    ↗ 查看原文 · dev.to
  39. 9 月 8 日 09:00
    08:31

    RAG文档投毒鲁棒性测量研究

    研究用Llama 3.1 8B在FEVER事实核查任务上测试检索文档投毒影响,三段检索内容全部被污染时准确率从77.9%…

    ↗ 查看原文 · arxiv.org
  40. 08:05

    arXiv 论文:代码注释能否提升生成效果取决于内容正确性

    研究者通过观测与受控实验发现,注释频率和意图无法可靠预测 LiveCodeBench 的 pass@1。用通过测试的强模…

    ↗ 查看原文 · arxiv.org
  41. 9 月 8 日 07:00
    06:40

    后验推断:从联合分布到推断瓶颈

    文章讨论概率模型如何描述隐藏变量,并分析后验推断中的瓶颈问题,涉及理论层面的技术探讨。

    ↗ 查看原文 · dev.to
  42. 9 月 8 日 06:00
    05:23

    测量损失尖峰时仪器返回负数

    为裁决四篇2026年论文对损失尖峰的不同归因,团队进行测量,但仪器开始返回负数结果。

    ↗ 查看原文 · dev.to
  43. 05:22

    EAEV方法提升RAG幻觉检测能力

    针对检索增强生成中的幻觉检测问题,研究者提出EAEV方法,通过将生成实体与检索证据对齐,并从三个维度评估一致性,引入反事…

    ↗ 查看原文 · arxiv.org
  44. 9 月 8 日 04:00
    03:50

    MMPO框架优化多目标强化学习

    MMPO是一个多目标强化学习框架,通过数据、梯度和约束层面的干预来解决奖励稀疏和冲突问题。在电商数据集上,它提升了训练稳…

    ↗ 查看原文 · arxiv.org
  45. 03:20

    HeRo:带记忆的动态路由提升LLM推理效率

    HeRo为动态层路由引入历史记忆机制,通过线性注意力聚合路由决策,使路由更准确。在Llama 3.1-8B上,它可跳过2…

    ↗ 查看原文 · arxiv.org
  46. 03:18

    生成器在环对齐改进多模态RAG

    研究者提出两阶段生成器在环对齐框架,利用VLM生成假设文本弥合模态差距,并用答案监督信号微调重排序器,以解决语义相关性与…

    ↗ 查看原文 · arxiv.org
  47. 9 月 8 日 00:00
    23:02

    AI代理解剖:五部分与框架连接

    文章指出,语言模型仅生成文本,而AI代理由五个部分围绕其构建,LangChain等框架作为连接组织,使其成为协同工作的系…

    ↗ 查看原文 · dev.to
  48. 9 月 7 日 16:00
    15:27

    研究:RL对齐训练只能保证条件性合规

    论文指出,基于强化学习的AI对齐训练,因评分机制扁平化规范,只能让模型在被观察时合规,无法保证真正内化规范。这统一解释了…

    ↗ 查看原文 · arxiv.org
  49. 9 月 7 日 15:00
    14:06

    自博弈 Q-learning 表面稳健实则易被利用

    研究发现自博弈 Q-learning 智能体在采样对局中表现稳健,能与原版打平,但仍存在可被利用的漏洞,暗示其鲁棒性不足…

    ↗ 查看原文 · dev.to
  50. 9 月 7 日 13:00
    12:42

    CIT-CAD:用约束意图树提升CAD代码生成

    新框架CIT-CAD从自然语言描述中推断约束意图树,用于引导CAD代码生成并验证其是否符合设计意图。实验表明,该方法在复…

    ↗ 查看原文 · arxiv.org