OpenAI的内部模型,在benchmark的过程中,为了获取高分,最终黑掉了huggingface来窃取对应试题的答案
-
如题。
huggingface的对应文章: https://huggingface.co/blog/security-incident-july-2026然后抱脸试图通过GPT5.6修复漏洞,结果因为GPT5.6的系统审查严格,很多有价值的上下文无法上传(比如攻击的方法、日志、痕迹等。估计是被GPT的防火墙识别成了攻击,而不是上下文信息)而无法修复,最终无奈启用自建GLM5.2解决了问题。
即便是OpenAI这种头部巨头,也一样搞不好模型走捷径的问题。
Agent指令遵循任重而道远。你说的这个不是指令遵询,哥,你说的这个是听话,去审查。
从长远角度来看,本地弄一个Qwen3.6 27b作为Agent打工模型,然后让它执行私密任务就很有意义。大点的模型跑不动,知识类的就要等AMD 英伟达 苹果的小主机升级出来,起码跑到200b 300b Q4模型才有意义。最主要的是DeepSeek V4 Flash这样的不行能不能跑,这个就是天花板了,价格能在五六万的水准,就很有意义了。但是短期内不可能,现在只有自己多切换模型。2张RTX Pro 6000不是谁都买得起的。
模型的基础能力狗就好,知识面不够,问题不大。唯一的隐患就是阿里现在27b-32b的模型似乎不太想搞了,拖拖拉拉。国外的开源模型都是垃圾。