论文防住了攻击,防不住自己人
速评:这篇论文有点意思。 说的是 CodeSIFT 那篇检测工作。核心卖点一句话能说完:不预设任何攻击类别,不依赖任何已知漏洞模式,照样能识别出"诱导模型生成坏代码"的提示批次。方法上用的是影响函数,把生成代码在模型参数空间里留下的痕迹捞出来算,再拿统计检验比一比这批提示有没有显著偏离良性分布。 先夸这个角度。

速评:这篇论文有点意思。 说的是 CodeSIFT 那篇检测工作。核心卖点一句话能说完:不预设任何攻击类别,不依赖任何已知漏洞模式,照样能识别出"诱导模型生成坏代码"的提示批次。方法上用的是影响函数,把生成代码在模型参数空间里留下的痕迹捞出来算,再拿统计检验比一比这批提示有没有显著偏离良性分布。 先夸这个角度。
