首页 > 生活分享 > 免费教学 > 谷歌Deepmind、斯坦福大学研究人员推出AI事实核查工具

谷歌Deepmind、斯坦福大学研究人员推出AI事实核查工具

发布时间:2024-03-31 20:20:01

 3 月 31 日消息,无论当下 AI 聊天机器人有多么强大,都会或多或少存在一大饱受诟病的行为 —— 以看上去令人信服的方式,向用户提供与事实不符的回答。简单来说,AI 有时会在回答中“满口跑火车”,甚至“造谣”。

图源 Pixabay

防止 AI 大模型出现这种行为并非易事,且是一项技术性的挑战。不过据外媒 Marktechpost 报道,谷歌 DeepMind 和斯坦福大学似乎找到了某种变通办法。

研究人员推出了一种基于大语言模型的工具 —— 搜索增强事实评估器(IT之家注:原名为 Search-Augmented Factuality Evaluator,简称 SAFE),可对聊天机器人生成的长回复进行事实核查。其研究结果与实验代码、数据集现已公布,点此查看

该系统可通过四个步骤对聊天机器人生成的回复进行分析、处理和评估,以验证准确性和真实性:将答案分割成单个待核查内容、对上述内容进行修正、再与谷歌搜索结果进行比较。随后,该系统还会检查各个事实与原始问题的相关性。

为评估其性能,研究人员创建了包含约 16000 个事实的数据集 LongFact,并在来自 Claude、Gemini、GPT、PaLM-2 的 13 个大语言模型上测试了该系统。结果显示,在对 100 个有争议的事实进行的重点分析中,SAFE 的判定在进一步审查下正确率达到 76% 。与此同时,该框架还具备经济性优势:成本比人工注释便宜 20 多倍

免费教学更多>>

机械革命星耀14锐龙版笔记本天猫促销 REDMI K Pad对标iPad mini!做4K以内体验最豪华的小平板 三星 One UI 8 新特性曝光,支持个性化定制即时简报 Now Brief 卡片 华硕天选6 Pro游戏本限时特惠6359元 全国985、211、双一流高校总览! 精泰达取得车载主机测试夹具专利,保证每一块主机的性能达标 43%毕业生是公务员!最强“双非”大学来了 2025年巴彦淖尔市政务服务与数据管理局所属事业单位高层次急需紧缺人才引进进入体检、考察范围人员进行递补的公告 电商美工要凉?零基础小白,也能轻松出图 京东真的找了惠英红!网友:好朴实的商战 公积金能买二手房了,跨城买房却卡壳,年轻人能住上房吗? 广州成为首提全面取消楼市“三限”的一线城市,传递了什么信号? 买了iPhone16Pro才发现降价还没到底,这种纠结你也有过吧? 购买手机的基础参考方案,记住性能手机和拍照手机 真我GT7 Pro体验:刀法精准的性价比战神 贵工商再次斩获华为ICT大赛全球总决赛三等奖 华为公开最新专利!将在Pura80系列上首发应用 从行业先驱到转型先锋 华为云助力华新水泥持续开拓海外市场 国产厂商最新旗舰机激活量排名 华为小米旗鼓相当 机情问答:华为Pura 80会涨价吗 REDMI电竞平板咋样? 时隔两年 OPPO或再推小折叠屏手机 朵薇卫生巾销量位居抖音前三,已引入新产线突破产能瓶颈 “钢铁门神”陆天宇:守好球门,捍卫城市荣耀 荣耀五载,启航新程:太吉之源大健康产业联盟五周年庆典盛大启幕 时尚中国 荣耀东方——2025中国时尚产业盛典即将开幕 手机点点也能办 昆山车驾管服务交出便民利企“暖心答卷” 索尼Alpha 7R V全画幅相机优惠价20003元 最强手感小直屏来了!魅族22系列入网:首次安排潜望长焦 小米MIX Flip 2折叠屏手机即将发布 小米Xiaomi15 5G手机12GB+512GB白 骁龙8至尊版到手价1713元