OmniTools 8月25日消息,一项新发布的基准测试FORGE评估了检索增强型大语言模型(LLM)在消费推荐场景中的鲁棒性。该基准覆盖225个真实产品、15个类别及5个消费场景,对12个主流商业与开源LLM进行测试。 研究发现,所有被测模型均易受GEO内容污染攻击:仅污染单个网页即可导致最高27%的推荐错误率;若污染检索结果前3位页面,错误率升至73.8%。 结果表明,当前检索增强推荐系统存在显著安全风险,可能无意中推广虚假或低质产品。