AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 15 日 04:0003:01
- 9 月 15 日 03:0003:00
- 02:17
7名博士生3个月从零训练7B大模型,代码数据日志全公开
↗ 查看原文 · qbitai.com一个由7名博士生组成的团队用3个月从零训练出7B大模型,并公开代码、数据与训练日志,研发过程中有数百个Agent参与。
- 02:09
AquiLLM:开源权重 RAG 系统科研忠实度评估
↗ 查看原文 · arxiv.org论文对面向科研的开源权重离线 RAG-LLM 平台 AquiLLM 做领域专家评估,以天文学为案例考察检索与科学分析任务…
- 9 月 14 日 22:0021:34
寄存器 token 让扩散语言模型实现有界状态推理
↗ 查看原文 · arxiv.org研究者在掩码扩散语言模型中引入少量固定位置的寄存器 token,用其连续隐状态在清空已生成文本后继续承载推理进度。
- 21:09
Auto-HSI:用 LLM 在线生成机器人集群个性化控制界面
↗ 查看原文 · arxiv.org论文提出 Auto-HSI,让未受训操作者用自然语言和手势演示描述期望的集群行为,由 LLM 自动生成个性化状态机代码来…
- 9 月 14 日 21:0020:18
论文:LLM Agent 扩展表格模型搜索空间
↗ 查看原文 · arxiv.org研究让 LLM Agent 为表格模型设计扩展的 HPO 搜索空间,在 45 个数据集上多数模型家族性能提升,平均相对增…
- 20:06
论文:为编码 Agent 构建最小成本保障包络
↗ 查看原文 · arxiv.org研究提出任务条件下的保障包络,用类型化推理图从已有测试、类型检查等证据中选出最小成本子集来重新确立变更需保持的性质,50…
- 9 月 14 日 20:0020:00
CLEAR:医疗 LLM 跨源证据裁决框架
↗ 查看原文 · arxiv.org针对外部检索信息可能不相关或冲突的问题,CLEAR 从参数知识、本地语料和动态检索三条路径独立生成候选答案,再由聚合验证…
- 19:42
AgentGuard:从异常轨迹学习编码 Agent 护栏
↗ 查看原文 · arxiv.orgAgentGuard 从真实编码 Agent 的异常执行轨迹中自动提取失败模式并生成指令级约束,在 Claude Cod…
- 9 月 14 日 19:0018:04
论文:面向 Flash 存内计算的 LLM 推理方案
↗ 查看原文 · arxiv.org研究提出端到端纯整数量化与基于稀疏字典编码的 KV 缓存压缩,使 LLM 可在缺乏浮点支持、写入寿命有限的 Flash…
- 18:03
Sakana AI 提出 PC-ALM,无需反向传播训练千层网络
↗ 查看原文 · pub.sakana.aiSakana AI 发布 PC-ALM,用逐层局部动力学替代反向传播的前向与反向过程,可训练深达 1000 层的残差 M…
- 18:01
- 9 月 14 日 18:0017:05
爱立信用多智能体做代码审查,准确率 96%
↗ 查看原文 · arxiv.org爱立信提出多智能体代码审查方案,结合专用智能体技能与项目上下文,从可读性、可维护性、可靠性和性能四个维度评估代码变更。工…
- 9 月 14 日 17:0016:32
Amazon Science 探讨 ML 研究 agent 为何不过拟合
↗ 查看原文 · amazon.scienceAmazon Science 发布文章,讨论机器学习研究 agent 为何不出现过拟合,并将其与压缩联系起来。
- 16:30
CiteGuard-RAG:在检索与作答之间加一道校验
↗ 查看原文 · arxiv.org论文提出 CiteGuard-RAG,将混合检索、引用约束生成、句子级溯源校验与单次重生成结合,运行时决定答案接受、拒答…
- 16:29
Amazon Science 讨论:LLM 评审意见一致时该不该信
↗ 查看原文 · amazon.scienceAmazon Science 发布文章,讨论当多个 LLM 评审给出相同判断时是否应当采信,涉及用模型做评估时的可靠性问…
- 16:22
Atria Dawn Preview 发布:面向科研的智能体基础模型
↗ 查看原文 · arxiv.org研究团队推出 Atria Dawn Preview,一个面向科研与工程流程的智能体基础模型,通过可验证经验管线训练。在…
- 16:18
MIT 提出 HardFlow,让生成式 AI 输出满足硬性安全约束
↗ 查看原文 · theframenews.orgMIT 团队开发出 HardFlow,只在生成最后一步校验硬性规则,无需重训模型即可让输出满足严格安全要求。模拟测试中每…
- 16:12
论文提出 k-稳健联盟对齐,保障多智能体审核安全
↗ 查看原文 · arxiv.org研究针对长时运行智能体的授权控制问题,提出 k-稳健联盟对齐条件:当任意 k 个审核者被移除后,委托方效用仍可表示为剩余…
- 16:11
SCoRE:面向视觉 RAG 的显式证据选择与整合方法
↗ 查看原文 · arxiv.org研究提出 SCoRE,通过维护文本账本保留查询相关观察及其来源指针,终止时重新加载原图并整合为有序视觉证据,将最终推理与…
- 9 月 14 日 15:0014:50
论文:用 ReAct SFT 提升 Qwen3-Coder-30B 竞技表现
↗ 查看原文 · arxiv.org研究以 CodeClash 代码竞技场为场景,发现 Qwen3-Coder-30B 常出现语法与协议错误、跨轮策略适应弱…
- 14:45
CIDERS:云边 LLM 协同学习的个性化双层优化框架
↗ 查看原文 · arxiv.org研究提出个性化双层优化框架 CIDERS,上层优化边缘个性化、下层负责云端知识迁移,并给出收敛性保证。实验显示压缩边缘路…
- 14:44
RAG-CT:通过扫描提示分布降低 RAG 隐私泄露
↗ 查看原文 · arxiv.org针对 RAG 检索过程可能被利用来提取语料中个人身份信息的问题,作者提出 RAG-CT,通过分析查询的熵与间隔分布来识别…
- 14:41
CiteShade:RAG 引用洗白攻击及反事实防御
↗ 查看原文 · arxiv.org研究揭示 RAG 引用通道可被攻击:控制单一来源即可诱导模型输出错误答案并归因于可信来源。在多跳问答上错误率从 0.01…
- 14:31
- 9 月 14 日 14:0013:20
SVG 绘图提示词测试更新 2026 版,对比多家模型表现
↗ 查看原文 · gally.net有人沿用 Simon Willison 的“鹈鹕骑自行车”思路,用 30 条 SVG 绘图提示词在 2025 和 202…
- 13:10
CauterRule v0.3.1 发布,已上线 GitHub 与 PyPI
↗ 查看原文 · dev.to作者复盘两个表现最差的语料库,发现问题不在模型而在于空数据集;同时发布 CauterRule v0.3.1,已上线 Gi…
- 13:05
- 9 月 14 日 13:0012:29
Spook the Machine:用游戏化方式研究人类如何吓唬AI
↗ 查看原文 · arxiv.org研究者推出游戏化平台 Spook the Machine,让参与者生成图像吓唬带有性格化恐惧的AI代理。
- 9 月 14 日 12:0011:48
论文评估AI代理任务级权限架构,攻击面可缩减84.4%
↗ 查看原文 · arxiv.org研究对基于任务的AI代理权限架构做了端到端评估,用微调的RoBERTa-large实现安全门控,分类质量接近Claude…
- 11:31
- 11:20
CodeTS:用可执行代码实现可验证的文本生成时间序列
↗ 查看原文 · arxiv.org研究提出CodeTS框架,将文本到时间序列生成重构为文本到代码再到时间序列的过程,用可执行代码显式表达生成逻辑。该方法通…
- 9 月 14 日 11:0011:00
- 10:04
论文提出多LLM系统收益函数与内爆阈值概念
↗ 查看原文 · arxiv.org研究提出Universe of Universes框架,把主流大模型生态视为检索语料,并形式化定义收益产出函数与内爆阈值…
- 9 月 14 日 10:0010:00
- 09:35
博客:你的 ML 模型评分可能在骗你的 5 种方式
↗ 查看原文 · dev.to一位开发者回顾自己不得不撤回已发布结果的经历,指出模型在验证集上的评分可能具有误导性。文章列举了 5 种评分失真的常见情…
- 09:02
arXiv 评测开源 LLM 在 ESG 报告中的 RAG 表现
↗ 查看原文 · arxiv.org论文基于 498 份欧盟上市公司 ESG 报告,评测 7 个 2B 至 30B 开源模型。检索指标普遍较好,但事实正确率…
- 9 月 14 日 09:0008:54
CWM:可控白盒元提示提升自适应 RAG 与推理
↗ 查看原文 · arxiv.org研究提出 CWM 白盒元提示方法,无需外部决策模块或多轮采样,在三个自适应 RAG 基准上取得最优结果,并可扩展到推理任…
- 08:17
分子之心 QuantaMind 登 Science Advances,聚焦动态分子设计
↗ 查看原文 · qbitai.com分子之心的 QuantaMind 研究登上 Science Advances,报道称其让 AI 蛋白质设计从静态结构走向…
- 9 月 14 日 08:0007:05
MediClear:用 LLM 简化糖尿病医学知识
↗ 查看原文 · arxiv.org研究构建基于 RAG 的 MediClear 系统,将糖尿病相关文章简化为患者易懂表述。可读性指标显示其稳定降至推荐阅读…
- 9 月 14 日 05:0005:00
AI/ML 研究速览:混合精度注意力量化将开销减半
↗ 查看原文 · dev.to一份 9 月 12 日的 AI/ML 研究速览汇总了多模态与语言模型的效率进展,其中混合精度注意力量化可将相关开销减半。
- 05:00
- 04:44
研究:毒化样本选择可大幅影响 LLM 后门攻击成功率
↗ 查看原文 · arxiv.org论文指出固定毒化样本数量、随机采样会低估最坏情况风险:在 LLaMA-3-8B 上攻击成功率可因样本集合不同从 3% 升…
- 9 月 14 日 04:0004:00
Muon 并未取代 AdamW,每次运行仍含 AdamW
↗ 查看原文 · dev.to有开发者指出,Muon 常被写成终于击败 AdamW 的优化器,但阅读 Keller Jordan 原始实现可发现每次…
- 03:57
MTAC-IFBench:多轮智能体编程指令遵循基准
↗ 查看原文 · arxiv.org研究者提出 MTAC-IFBench,用于评测代码智能体在多轮开发中遵循流程指令与约束的能力。每个实例平均 7.04 轮…
- 03:45
- 03:44
- 03:39
跨生态包实证研究:六百万包中的架构与健康度
↗ 查看原文 · arxiv.org一项覆盖六大生态、超六百万个包的研究考察跨生态发布包(如同时上 NPM 与 PyPI)的普遍程度与架构模式,识别出五种模…
- 9 月 14 日 03:0003:00
零参数缓存对比小 Transformer:训练数据翻倍收益有限
↗ 查看原文 · dev.to针对零参数缓存胜过小 Transformer 的质疑,作者用 16 倍训练数据测试,交叉点仅移动 6.6 倍,相当于文档…