AI 快讯
LIVE · 24h全网 AI 动态的中文速报,聚合引擎每 15 分钟更新。
- 9 月 21 日 17:0016:24
Anthropic 威胁报告:AI 已能执行攻击而非仅描述
↗ 查看原文 · dev.toAnthropic 9 月威胁报告记录了 AI 实际执行攻击的案例,而不只是描述攻击方法。文章认为真正的 AI 风险在于…
- 16:09
解析 Transformer 机制、注意力数学与内存瓶颈
↗ 查看原文 · dev.to一篇技术文章从底层拆解 Transformer 的注意力计算与内存瓶颈,指出规模化 AI 常被简化为调用 REST 接口…
- 16:07
- 16:04
MSI-Bench 发布:评测多说话人语音交互
↗ 查看原文 · arxiv.org研究者推出 MSI-Bench,用 1152 个中英各半的多方多轮音频场景评测语音智能体的多说话人记忆、指令跟随与推理。…
- 9 月 21 日 16:0015:46
解析 S7comm 协议:从 ISO-on-TCP 到 PLC 内存
↗ 查看原文 · dev.to文章由 RUGERO Tesla 撰写,深入解析 S7comm 协议,从 ISO-on-TCP 传输层讲到 PLC 内存…
- 15:24
Epi-Logic:智能体认知运行时控制框架
↗ 查看原文 · arxiv.org论文提出 Epi-Logic 概念框架,针对智能体沿用失效解释框架的 schema 错配问题,结合错配检测、自主性分级降…
- 9 月 21 日 15:0014:11
用 persona 化 LLM 模拟增强 A/B 测试
↗ 查看原文 · arxiv.org研究者提出学习增强假设检验框架,利用质量未知的模型预测在保持统计有效性的前提下缩小实验样本量,并给出群体级与个体级两种方…
- 9 月 21 日 14:0014:00
单文件与模块化代码,哪种更不容易让 LLM 出错
↗ 查看原文 · dev.to一位开发者在 DEV 社区分享实验,比较单文件与模块化代码对 LLM 表现的影响,并称实验以失败告终。作者认为模块化代码…
- 13:44
Hugging Face 论文:把 LLM 块剪枝建模为 Ising 优化问题
↗ 查看原文 · huggingface.coMultiverse Computing 团队提出将大模型块删除(深度剪枝)的选择问题转化为受限二元优化,映射为全连接…
- 9 月 21 日 13:0012:56
- 12:53
论文提出面向AI Agent的安全事件报告框架
↗ 查看原文 · arxiv.org研究者对比AI系统与AI Agent,结合23位学界与业界专家意见,梳理出Agent安全事件报告所需信息,如记忆与记忆访…
- 12:46
Decart 的 Oasis 证明 AI 生成游戏可玩
↗ 查看原文 · dev.to一篇 DEV 文章讨论 Decart 的 Oasis,指出 AI 生成游戏已能在可玩帧率下运行,但作者认为“没有物理引擎…
- 12:27
- 12:07
Noema 刊文:AI 正在冲击精英选拔制
↗ 查看原文 · noemamag.comBerggruen Institute 旗下 Noema Magazine 刊出 Branko Milanović 与…
- 9 月 21 日 10:0009:53
- 09:42
论文提出AI辅助软件开发生命周期AI-SDLC
↗ 查看原文 · arxiv.org该研究面向受治理的Agent软件开发,提出轻量、规格驱动的生命周期,结合规格文件、AGENTS.md与分阶段技能文件,让…
- 09:41
LADDER:图引导扩散语言模型加速多跳推理
↗ 查看原文 · arxiv.org研究将扩散语言模型与GraphRAG结合,提出事件驱动自时钟检索与不完整查询图传播模块,在三个多跳问答基准上平均精确匹配…
- 09:30
- 09:02
- 9 月 21 日 09:0008:11
Taramandal-GPT:面向航天动力学的领域模型
↗ 查看原文 · arxiv.org该框架基于Qwen3-8b,加入RAG流程与回退机制,在包含299道题的航天动力学基准APBench上,与主流开源及闭源…
- 9 月 21 日 08:0007:56
ego-browser 提出每步 DOM 一次类型化调用
↗ 查看原文 · dev.toDEV Community 介绍 ego-browser 中的 System One 内循环,用每步 DOM 一次类型化…
- 07:47
- 9 月 21 日 07:0006:48
孟加拉法律领域LLM蒸馏出手机端RAG模型
↗ 查看原文 · arxiv.org研究通过两阶段渐进蒸馏将90亿参数Gemma-2压缩为20亿参数学生模型,结合稠密检索与BM25检索孟加拉国3.6万余条…
- 9 月 21 日 06:0005:38
- 05:19
- 9 月 21 日 05:0005:00
- 04:12
- 9 月 21 日 04:0003:41
团队公开融资预测模型与失败记录:219 轮融资的经验
↗ 查看原文 · dev.to该团队公开了预测方法、数据集和预测台账,其中包括首个批次 10 次全错的记录,并分享了用公开 GitHub 数据预测 A…
- 9 月 21 日 03:0002:47
- 02:36
博客:编码理论趣味入门
↗ 查看原文 · paramrathour.github.io一篇面向零基础读者的编码理论科普文章发布,用童年用手电筒隔窗传字母的设想引出通信编码问题,并逐步讨论如何设计不易被误读的…
- 02:20
自训 310M 编码器与 Jev 对比:三项任务各有胜负
↗ 查看原文 · dev.to开发者用 750 行数据跑了三个日语分类任务,每项 250 行、标注相同,对比自训 310M 编码器与 Jev,结果两项…
- 9 月 21 日 02:0001:43
Jev-Mem:System-One 控制的智能体记忆架构
↗ 查看原文 · arxiv.orgJev-Mem 将快慢思考分工引入智能体记忆,由 System-One 控制平面负责记忆组织与检索调度,System-T…
- 01:21
MobileCybench:用可执行探针评测智能体漏洞发现
↗ 查看原文 · arxiv.org研究者提出以可执行探针评估漏洞报告,并构建覆盖 13 个 Android 应用的 MobileCybench 基准,含…
- 9 月 21 日 00:0000:00
- 23:54
AgentForge-Bench:评测智能体伪造 PDF 文档能力
↗ 查看原文 · arxiv.org研究者构建 AgentForge-Bench,测试现成编码智能体在真实财务 PDF 中篡改金额、日期或地址的能力。175…
- 23:31
XYEval:智能体面对误导性建议会大幅掉分
↗ 查看原文 · arxiv.org研究者提出 XYEval 框架,把现有基准改造成 XY 问题评测,考察智能体能否识别用户提出的错误方向。在六个基准上测试…
- 23:19
字节 Seed 与清华 AIR 开源 RL 系统 DAPO
↗ 查看原文 · github.com字节 Seed 与清华 AIR 开源大规模 LLM 强化学习系统 DAPO,含算法、代码与数据集,基于 verl 框架…
- 9 月 20 日 22:0021:48
25 个审查者组成的评审团实测有效规模仅 1.00
↗ 查看原文 · dev.to作者指出生成代码的成本已大幅下降,但可信的审查没有跟上,于是增加审查者数量。用 25 个审查者组成的评审团实测,其有效规…
- 21:30
Q-TIE:面向时序信息检索的轻量重排序框架
↗ 查看原文 · arxiv.org研究提出 Q-TIE,用学习式时序意图抽取把查询的时间约束映射为统一区间表示,兼顾时序检索器的灵活理解与时序重排序器的显…
- 9 月 20 日 20:0019:14
- 9 月 20 日 19:0018:55
- 18:54
FLARE:用生成式奖励模型做编码智能体全周期监督
↗ 查看原文 · arxiv.org研究提出 FLARE 密集监督范式,通过因果回溯蒸馏出轻量生成式奖励模型,在推理时拦截高风险步骤重执行,在训练时提供过程…
- 18:50
WorkWorlds:把组织状态与任务描述分离的智能体评测
↗ 查看原文 · arxiv.org研究提出 WorkWorlds 评测基础设施,先固定组织状态与员工席位,再引入任务,避免任务描述泄露上下文。
- 9 月 20 日 18:0017:59
- 9 月 20 日 17:0016:14
Anthropic 发布首个内部 R&D 自动化指数
↗ 查看原文 · dev.toAnthropic 公布首个内部 R&D 自动化指数,称 Claude 承担了 26% 的相关工作,该指数衡量的是监督而…
- 9 月 20 日 16:0015:59
文章称 Prompt 并不真实,主张用评估与优化流水线替代
↗ 查看原文 · evaluation.club一篇在 Hacker News 传播的文章认为,与 LLM 交换文本的 prompt 并非本质,主张转而构建互相衔接的评…
- 9 月 20 日 13:0012:20
文章:聊天式 LLM 复刻了通灵者的骗术机制
↗ 查看原文 · softwarecrisis.devBaldur Bjarnason 提出 LLMentalist Effect,认为聊天式大模型让用户误以为其具有智能,而…
- 9 月 20 日 12:0011:50
- 11:44
VibeMemBench:评测编码智能体的记忆系统
↗ 查看原文 · arxiv.org研究者提出 VibeMemBench,用 90 个仓库的 111 个编码任务和 3634 条历史轨迹评测记忆系统。
- 11:34
8 篇必读论文:Agent Harness 进展
↗ 查看原文 · dev.to过去两个月 arXiv 上出现一批关于 Agent Harness 的论文,作者来自阿里巴巴 DreamX 等团队,文章…