AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 11 日 15:0014:59
- 14:24
同一模型换 4 种分词器,准确率差 30 个百分点
↗ 查看原文 · dev.to一篇 DEV 文章对比同一模型、同一数据下 4 种分词方式,结果显示准确率差距达到 30 个百分点,说明分词方案对结果影…
- 9 月 11 日 14:0013:33
开发者称多数 AI 推理轨迹只是把答案倒着写出来
↗ 查看原文 · dev.toDEV Community 一篇文章指出,多数 AI 展示的逐步推理过程可能只是把最终答案倒推着写出来,而非真正的推理链…
- 9 月 11 日 12:0011:57
研究:AI 生成的弱测试会让编码 Agent 表现更差
↗ 查看原文 · dev.toCritic 研究发现,质量差的生成测试会降低修复成功率,并给出可运行的 Python 示例,用于识别会放行错误修复的测…
- 11:41
- 11:17
观点文章:AI 正让科研协作变得更少
↗ 查看原文 · researchagenda.newsHoltzbrinck 集团首席科学官 Daniel Hook 撰文提出「Waymo 效应」,认为像无人车这类无摩擦技术…
- 9 月 11 日 09:0008:44
两个主题 LoRA 适配器实验:各自表现与留出权衡
↗ 查看原文 · dev.toDEV Community 发布一篇实验记录,测试两个针对不同主题的 LoRA 适配器能否共存。结果显示 LoRA 在各…
- 08:06
- 9 月 11 日 05:0004:02
- 9 月 11 日 02:0001:46
爆料称 OpenAI 用千禧年难题霍奇猜想做 Benchmark
↗ 查看原文 · qbitai.com有爆料称 OpenAI 将千禧年数学难题霍奇猜想用作模型评测基准。消息尚未得到官方确认,具体细节不明。
- 9 月 11 日 01:0000:53
- 00:39
- 00:33
YuE2 发布:符号规划与音频生成统一的音乐模型
↗ 查看原文 · map-yue2.github.ioMBZUAI 等机构发布 YuE2,将符号与音频音乐生成统一在一个约 3.59B 参数模型中,先写出可编辑乐谱再生成人声…
- 9 月 10 日 21:0020:15
- 9 月 10 日 20:0019:15
Agent 通过 SWE-Bench Pro 因 git show 仍留有修复
↗ 查看原文 · dev.to上海 AI Lab 于 9 月 8 日发布 SWE-Bench Pro Verified。当 gold patch 移出…
- 19:07
博客:下一代 Transformer 的循环结构并非关键
↗ 查看原文 · zartbot.github.io一篇技术博客讨论 Loop Transformer,认为应区分 Loop 与 Recursive 两类结构,并称权重共享…
- 9 月 10 日 19:0018:02
- 9 月 10 日 18:0017:23
Anthropic 发布 2026 年 9 月 AI 滥用检测与反制报告
↗ 查看原文 · anthropic.comAnthropic 威胁情报团队披露 2025 年 12 月至 2026 年 8 月间阻断的恶意使用案例,涉及网络攻击…
- 9 月 10 日 17:0016:12
- 9 月 10 日 16:0015:43
- 9 月 10 日 15:0014:46
- 14:27
- 14:23
- 14:03
EXYGEN 框架实现大规模知识图谱对话式访问
↗ 查看原文 · arxiv.org研究者提出 EXYGEN 框架,用 VoID 描述与 ShEx 模式构建 RAG 流程,无需微调即可在 SciQA 上达…
- 9 月 10 日 14:0013:36
开源记忆层 nautilus-compass 在 LongMemEval-S 检索上超过 mem0
↗ 查看原文 · dev.to开源 agent 记忆层 nautilus-compass 在 LongMemEval-S 全量 500 条检索评测中…
- 13:06
开发者将 JPEG AI 移植到 Apple 芯片,首次基准测试耗时多在启动
↗ 查看原文 · dev.to有开发者用 Core ML 实现了原生 JPEG AI 编解码器,并给出真实的 y、z 激活图。作者指出首次测试耗时约五…
- 9 月 10 日 13:0012:59
赛诺菲合作研究:多层知识图谱用于 CMC 工艺开发
↗ 查看原文 · arxiv.org研究团队提出模块化智能体平台,将工艺开发文档转为双层知识图谱,在赛诺菲小分子项目 505 个问题上取得 95% 一级选择…
- 12:57
研究提出「约定差距」指标衡量 AI 隐含沟通能力
↗ 查看原文 · arxiv.org研究者用 Hanabi 游戏提出「约定差距」指标,回放约 10.1 万次对局发现人类配对差距为 +26.2 个百分点,A…
- 12:46
- 9 月 10 日 12:0011:25
VikingRAG:面向结构化文档的高效检索增强生成
↗ 查看原文 · arxiv.org研究者提出目录感知的语义数据管理系统 VikingRAG,通过复用多轮检索轨迹与自适应升级策略,在保持精度的同时将 to…
- 9 月 10 日 11:0010:01
- 9 月 10 日 10:0009:31
研究:ChatGPT 使用方式多样性比是否使用更影响安全编码成绩
↗ 查看原文 · arxiv.org一项针对 26 名网络安全硕士生的实证研究发现,不同经验水平的学生使用 ChatGPT 的策略大体相似,使用模式多样性与…
- 09:25
AgentZip:面向 AI Agent 沙箱的内存压缩系统
↗ 查看原文 · arxiv.org研究者提出 AgentZip,利用沙箱共享模板与跨沙箱的内存冗余做压缩,在 LLM 训练与推理负载下将沙箱内存最多降低…
- 9 月 10 日 09:0008:14
REVA:用可复用证据视图降低 RAG 上下文成本
↗ 查看原文 · arxiv.org研究提出 REVA 框架,把历史查询与文档的注意力痕迹聚合为可复用的证据视图,在四个基准上生成质量提升 1.0 至 5.…
- 9 月 10 日 08:0007:57
大晓机器人等发布人–场景交互重建框架HSImul3R
↗ 查看原文 · qbitai.com大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布人–场景交互重建框架HSImul3R,可将人类视频转化为机器…
- 07:34
SemVerBench:首个评测 LLM 版本约束解析语义的基准
↗ 查看原文 · arxiv.org研究者发布 SemVerBench,覆盖 npm、PEP 440、Cargo 三个生态共 240 道可机器校验题目,测试…
- 07:27
BrainStem_V8 神经符号 AI 提出需要睡眠
↗ 查看原文 · dev.to有开发者介绍神经符号 AI 项目 BrainStem_V8,提出下一代 AI 需要类似睡眠的机制,并给出五条来自生物数字…
- 9 月 10 日 06:0005:34
研究:多智能体 LLM 质性编码的准确率与争论强度相关
↗ 查看原文 · arxiv.org一项研究让多个 AI 智能体独立编码、辩论并调和分歧,发现编码准确率受码本长度、数据相似度和智能体分歧影响,激烈且未解决…
- 9 月 10 日 05:0005:00
- 04:54
- 04:32
arXiv 发布 SaltBench:用机器裁判衡量编码智能体方法效果
↗ 查看原文 · arxiv.org该协议让证明内核或程序验证器等机器裁判决定智能体工作价值,智能体无法申辩。研究用 Rust 编写五个组件测试四种配置,发…
- 04:12
MOSAIC:面向 GraphRAG 的查询感知探索策略
↗ 查看原文 · arxiv.org该免训练框架把 GraphRAG 检索建模为逐查询控制问题,由 LLM 分析器生成种子选择、图遍历与停止策略。
- 9 月 10 日 04:0004:00
- 03:20
Agent Incident Registry:建立 AI 智能体事故登记库
↗ 查看原文 · arxiv.org该登记库以来源可追溯的方式收录智能体相关事件,含证据、稳定标识及因果角色、披露类别、机制与结果标签。作者称其支持案例检索…
- 03:05
- 03:02
- 9 月 10 日 03:0003:00
实验:TinyStories 的关键是领域而非词表
↗ 查看原文 · dev.to作者将词表限制在 1500 词复现 TinyStories,结果 top-1 比 4000 词上限差 4 个百分点,超三…
- 02:50
- 9 月 10 日 02:0001:59
博客提出基于规格博弈的AI对齐新思路
↗ 查看原文 · slimemoldtimemold.comSLIME MOLD TIME MOLD 博客借 DeepMind 安全研究整理的规格博弈行为清单,提出一个AI对齐的设…
- 01:49