RiskChainBench评估混淆平台消息还原与基于证据的网络调查
RiskChainBench评估人工智能模型能否还原使用表情符号、谐音、字符拆分和冗余符号隐藏的平台消息,并调查正确对应的网站。该基准包含来自600个会话的3,600条合成还原输入,以及600个由人工标注的本地网页环境。评估内容包括消息还原、正确跳转和生成有证据引用的风险报告。对10个模型的测试显示,入口Top-1准确率为35.2%至95.2%,网页判断准确率为26.3%至62.8%。31.9%的网页运行因执行失败而中止,而判断后的类型错误仅占0.9%,表明稳定的网页探索和风险判断仍是主要瓶颈。研究团队发布了基准、评测协议和可重置的本地沙盒。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。