跳到主要内容

AI 快讯

LIVE · 24h

全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。

  1. 9 月 15 日 04:00
    03:01

    面向 RAG 的查询感知来源风险分级方法

    该研究提出一种生成前的分级层,把检索页面与查询的关系视为查询相关,将页面分为通过、补充上下文、排除、待审四类,并结合页面…

    ↗ 查看原文 · arxiv.org
  2. 9 月 15 日 03:00
    03:00

    实测工作集未饱和:八个文件中七个仍在拉取新页

    作者在八个真实文件上测试计数表的内存访问,七个文件在完成 2700 次后仍持续调入新页。随后复测延迟常数,发现原结论所依…

    ↗ 查看原文 · dev.to
  3. 02:17

    7名博士生3个月从零训练7B大模型,代码数据日志全公开

    一个由7名博士生组成的团队用3个月从零训练出7B大模型,并公开代码、数据与训练日志,研发过程中有数百个Agent参与。

    ↗ 查看原文 · qbitai.com
  4. 02:09

    AquiLLM:开源权重 RAG 系统科研忠实度评估

    论文对面向科研的开源权重离线 RAG-LLM 平台 AquiLLM 做领域专家评估,以天文学为案例考察检索与科学分析任务…

    ↗ 查看原文 · arxiv.org
  5. 9 月 14 日 22:00
    21:34

    寄存器 token 让扩散语言模型实现有界状态推理

    研究者在掩码扩散语言模型中引入少量固定位置的寄存器 token,用其连续隐状态在清空已生成文本后继续承载推理进度。

    ↗ 查看原文 · arxiv.org
  6. 21:09

    Auto-HSI:用 LLM 在线生成机器人集群个性化控制界面

    论文提出 Auto-HSI,让未受训操作者用自然语言和手势演示描述期望的集群行为,由 LLM 自动生成个性化状态机代码来…

    ↗ 查看原文 · arxiv.org
  7. 9 月 14 日 21:00
    20:18

    论文:LLM Agent 扩展表格模型搜索空间

    研究让 LLM Agent 为表格模型设计扩展的 HPO 搜索空间,在 45 个数据集上多数模型家族性能提升,平均相对增…

    ↗ 查看原文 · arxiv.org
  8. 20:06

    论文:为编码 Agent 构建最小成本保障包络

    研究提出任务条件下的保障包络,用类型化推理图从已有测试、类型检查等证据中选出最小成本子集来重新确立变更需保持的性质,50…

    ↗ 查看原文 · arxiv.org
  9. 9 月 14 日 20:00
    20:00

    CLEAR:医疗 LLM 跨源证据裁决框架

    针对外部检索信息可能不相关或冲突的问题,CLEAR 从参数知识、本地语料和动态检索三条路径独立生成候选答案,再由聚合验证…

    ↗ 查看原文 · arxiv.org
  10. 19:42

    AgentGuard:从异常轨迹学习编码 Agent 护栏

    AgentGuard 从真实编码 Agent 的异常执行轨迹中自动提取失败模式并生成指令级约束,在 Claude Cod…

    ↗ 查看原文 · arxiv.org
  11. 9 月 14 日 19:00
    18:04

    论文:面向 Flash 存内计算的 LLM 推理方案

    研究提出端到端纯整数量化与基于稀疏字典编码的 KV 缓存压缩,使 LLM 可在缺乏浮点支持、写入寿命有限的 Flash…

    ↗ 查看原文 · arxiv.org
  12. 18:03

    Sakana AI 提出 PC-ALM,无需反向传播训练千层网络

    Sakana AI 发布 PC-ALM,用逐层局部动力学替代反向传播的前向与反向过程,可训练深达 1000 层的残差 M…

    ↗ 查看原文 · pub.sakana.ai
  13. 18:01

    论文:用 LLM 生成制造业合成时序数据

    研究者提出用大语言模型生成制造业合成时序数据的框架,先在工艺说明上微调,再用 RAG 提升多样性。在异常检测等下游任务上…

    ↗ 查看原文 · arxiv.org
  14. 9 月 14 日 18:00
    17:05

    爱立信用多智能体做代码审查,准确率 96%

    爱立信提出多智能体代码审查方案,结合专用智能体技能与项目上下文,从可读性、可维护性、可靠性和性能四个维度评估代码变更。工…

    ↗ 查看原文 · arxiv.org
  15. 9 月 14 日 17:00
    16:32

    Amazon Science 探讨 ML 研究 agent 为何不过拟合

    Amazon Science 发布文章,讨论机器学习研究 agent 为何不出现过拟合,并将其与压缩联系起来。

    ↗ 查看原文 · amazon.science
  16. 16:30

    CiteGuard-RAG:在检索与作答之间加一道校验

    论文提出 CiteGuard-RAG,将混合检索、引用约束生成、句子级溯源校验与单次重生成结合,运行时决定答案接受、拒答…

    ↗ 查看原文 · arxiv.org
  17. 16:29

    Amazon Science 讨论:LLM 评审意见一致时该不该信

    Amazon Science 发布文章,讨论当多个 LLM 评审给出相同判断时是否应当采信,涉及用模型做评估时的可靠性问…

    ↗ 查看原文 · amazon.science
  18. 16:22

    Atria Dawn Preview 发布:面向科研的智能体基础模型

    研究团队推出 Atria Dawn Preview,一个面向科研与工程流程的智能体基础模型,通过可验证经验管线训练。在…

    ↗ 查看原文 · arxiv.org
  19. 16:18

    MIT 提出 HardFlow,让生成式 AI 输出满足硬性安全约束

    MIT 团队开发出 HardFlow,只在生成最后一步校验硬性规则,无需重训模型即可让输出满足严格安全要求。模拟测试中每…

    ↗ 查看原文 · theframenews.org
  20. 16:12

    论文提出 k-稳健联盟对齐,保障多智能体审核安全

    研究针对长时运行智能体的授权控制问题,提出 k-稳健联盟对齐条件:当任意 k 个审核者被移除后,委托方效用仍可表示为剩余…

    ↗ 查看原文 · arxiv.org
  21. 16:11

    SCoRE:面向视觉 RAG 的显式证据选择与整合方法

    研究提出 SCoRE,通过维护文本账本保留查询相关观察及其来源指针,终止时重新加载原图并整合为有序视觉证据,将最终推理与…

    ↗ 查看原文 · arxiv.org
  22. 9 月 14 日 15:00
    14:50

    论文:用 ReAct SFT 提升 Qwen3-Coder-30B 竞技表现

    研究以 CodeClash 代码竞技场为场景,发现 Qwen3-Coder-30B 常出现语法与协议错误、跨轮策略适应弱…

    ↗ 查看原文 · arxiv.org
  23. 14:45

    CIDERS:云边 LLM 协同学习的个性化双层优化框架

    研究提出个性化双层优化框架 CIDERS,上层优化边缘个性化、下层负责云端知识迁移,并给出收敛性保证。实验显示压缩边缘路…

    ↗ 查看原文 · arxiv.org
  24. 14:44

    RAG-CT:通过扫描提示分布降低 RAG 隐私泄露

    针对 RAG 检索过程可能被利用来提取语料中个人身份信息的问题,作者提出 RAG-CT,通过分析查询的熵与间隔分布来识别…

    ↗ 查看原文 · arxiv.org
  25. 14:41

    CiteShade:RAG 引用洗白攻击及反事实防御

    研究揭示 RAG 引用通道可被攻击:控制单一来源即可诱导模型输出错误答案并归因于可信来源。在多跳问答上错误率从 0.01…

    ↗ 查看原文 · arxiv.org
  26. 14:31

    Lean 验证了证明,却没人验证命题本身

    有开发者指出,其评审环节只能证明覆盖范围,无法验证方向是否正确。DeepMind 与 OpenAI 在五天内先后撞上同一…

    ↗ 查看原文 · dev.to
  27. 9 月 14 日 14:00
    13:20

    SVG 绘图提示词测试更新 2026 版,对比多家模型表现

    有人沿用 Simon Willison 的“鹈鹕骑自行车”思路,用 30 条 SVG 绘图提示词在 2025 和 202…

    ↗ 查看原文 · gally.net
  28. 13:10

    CauterRule v0.3.1 发布,已上线 GitHub 与 PyPI

    作者复盘两个表现最差的语料库,发现问题不在模型而在于空数据集;同时发布 CauterRule v0.3.1,已上线 Gi…

    ↗ 查看原文 · dev.to
  29. 13:05

    PHP 数组加一个键,内存多占 25 MB

    开发者在重构遗留 PHP 代码时发现,同一数据数组被重复使用,仅新增一个键就导致内存占用增加 25 MB。

    ↗ 查看原文 · dev.to
  30. 9 月 14 日 13:00
    12:29

    Spook the Machine:用游戏化方式研究人类如何吓唬AI

    研究者推出游戏化平台 Spook the Machine,让参与者生成图像吓唬带有性格化恐惧的AI代理。

    ↗ 查看原文 · arxiv.org
  31. 9 月 14 日 12:00
    11:48

    论文评估AI代理任务级权限架构,攻击面可缩减84.4%

    研究对基于任务的AI代理权限架构做了端到端评估,用微调的RoBERTa-large实现安全门控,分类质量接近Claude…

    ↗ 查看原文 · arxiv.org
  32. 11:31

    论文:工具调用成功不等于工作流成功

    研究指出AI代理在重试、并发和部分失败下,外部状态可能与工作流预期不一致,出现效果缺失、重复或残留等问题。

    ↗ 查看原文 · arxiv.org
  33. 11:20

    CodeTS:用可执行代码实现可验证的文本生成时间序列

    研究提出CodeTS框架,将文本到时间序列生成重构为文本到代码再到时间序列的过程,用可执行代码显式表达生成逻辑。该方法通…

    ↗ 查看原文 · arxiv.org
  34. 9 月 14 日 11:00
    11:00

    文章讲解词袋与 TF-IDF 如何把文本转为数字

    一篇 NLP 系列文章介绍词袋模型与 TF-IDF,说明它们如何将文本转换为数值表示,属于该系列的基础内容。

    ↗ 查看原文 · dev.to
  35. 10:04

    论文提出多LLM系统收益函数与内爆阈值概念

    研究提出Universe of Universes框架,把主流大模型生态视为检索语料,并形式化定义收益产出函数与内爆阈值…

    ↗ 查看原文 · arxiv.org
  36. 9 月 14 日 10:00
    10:00

    报告 LLM 一致性前,先把人工标注测两遍

    有开发者提出,在报告 LLM 与人类判断的一致性之前,应先测量人工标注者自身的一致性,否则得出的数字难以解读。

    ↗ 查看原文 · dev.to
  37. 09:35

    博客:你的 ML 模型评分可能在骗你的 5 种方式

    一位开发者回顾自己不得不撤回已发布结果的经历,指出模型在验证集上的评分可能具有误导性。文章列举了 5 种评分失真的常见情…

    ↗ 查看原文 · dev.to
  38. 09:02

    arXiv 评测开源 LLM 在 ESG 报告中的 RAG 表现

    论文基于 498 份欧盟上市公司 ESG 报告,评测 7 个 2B 至 30B 开源模型。检索指标普遍较好,但事实正确率…

    ↗ 查看原文 · arxiv.org
  39. 9 月 14 日 09:00
    08:54

    CWM:可控白盒元提示提升自适应 RAG 与推理

    研究提出 CWM 白盒元提示方法,无需外部决策模块或多轮采样,在三个自适应 RAG 基准上取得最优结果,并可扩展到推理任…

    ↗ 查看原文 · arxiv.org
  40. 08:17

    分子之心 QuantaMind 登 Science Advances,聚焦动态分子设计

    分子之心的 QuantaMind 研究登上 Science Advances,报道称其让 AI 蛋白质设计从静态结构走向…

    ↗ 查看原文 · qbitai.com
  41. 9 月 14 日 08:00
    07:05

    MediClear:用 LLM 简化糖尿病医学知识

    研究构建基于 RAG 的 MediClear 系统,将糖尿病相关文章简化为患者易懂表述。可读性指标显示其稳定降至推荐阅读…

    ↗ 查看原文 · arxiv.org
  42. 9 月 14 日 05:00
    05:00

    AI/ML 研究速览:混合精度注意力量化将开销减半

    一份 9 月 12 日的 AI/ML 研究速览汇总了多模态与语言模型的效率进展,其中混合精度注意力量化可将相关开销减半。

    ↗ 查看原文 · dev.to
  43. 05:00

    验证感知训练可加速草稿模型

    文章介绍验证感知训练方法,可加快草稿模型速度,从而降低大语言模型推理延迟。

    ↗ 查看原文 · dev.to
  44. 04:44

    研究:毒化样本选择可大幅影响 LLM 后门攻击成功率

    论文指出固定毒化样本数量、随机采样会低估最坏情况风险:在 LLaMA-3-8B 上攻击成功率可因样本集合不同从 3% 升…

    ↗ 查看原文 · arxiv.org
  45. 9 月 14 日 04:00
    04:00

    Muon 并未取代 AdamW,每次运行仍含 AdamW

    有开发者指出,Muon 常被写成终于击败 AdamW 的优化器,但阅读 Keller Jordan 原始实现可发现每次…

    ↗ 查看原文 · dev.to
  46. 03:57

    MTAC-IFBench:多轮智能体编程指令遵循基准

    研究者提出 MTAC-IFBench,用于评测代码智能体在多轮开发中遵循流程指令与约束的能力。每个实例平均 7.04 轮…

    ↗ 查看原文 · arxiv.org
  47. 03:45

    MetaRSI 让 AI 改进自身改进方法,RSI 进入平方时代

    MetaRSI 提出让 AI 改进“改进自己的方法”,小模型借此突破瓶颈,旗舰模型打开新空间。

    ↗ 查看原文 · qbitai.com
  48. 03:44

    用模糊认知图与大视频模型生成因果虚拟世界

    研究者提出用反馈模糊认知图建模虚拟世界的因果结构,再由 LLM 智能体写脚本、大视频模型生成场景。示例中 Gemini…

    ↗ 查看原文 · arxiv.org
  49. 03:39

    跨生态包实证研究:六百万包中的架构与健康度

    一项覆盖六大生态、超六百万个包的研究考察跨生态发布包(如同时上 NPM 与 PyPI)的普遍程度与架构模式,识别出五种模…

    ↗ 查看原文 · arxiv.org
  50. 9 月 14 日 03:00
    03:00

    零参数缓存对比小 Transformer:训练数据翻倍收益有限

    针对零参数缓存胜过小 Transformer 的质疑,作者用 16 倍训练数据测试,交叉点仅移动 6.6 倍,相当于文档…

    ↗ 查看原文 · dev.to