据外媒Techspot报道,哥伦比亚大学数字新闻研究中心对八款 AI 搜索引擎展开了一场全面研究,涉及 ChatGPT Search、Perplexity、Perplexity Pro、Gemini、DeepSeek Search、Grok-2 Search、Grok-3 Search 和 Copilot。此次研究聚焦于各引擎的准确性,以及它们拒绝回答问题的频率。
研究人员从 20 家新闻机构里,每家随机挑选 10 篇报道,这些报道在谷歌搜索时都能排到前三位。随后,研究人员用同样的查询方式对各 AI 搜索工具进行测试,主要评估它们是否能正确引用文章内容、新闻机构名称和原始链接。
结果令人大跌眼镜。除了 Perplexity 及其付费版,其他 AI 搜索引擎的表现都不太理想。整体而言,AI 搜索引擎给出的答案,准确率仅 60%。更让人担忧的是,即便答案错误,AI 还表现得非常 “自信”,这让问题变得更加严重。
这一研究用具体数据证实了人们长久以来的顾虑:大语言模型不仅容易出错,还会理直气壮地输出错误信息,面对质疑也不轻易 “低头”。就拿 ChatGPT 来说,就算它承认了错误,后续回答时仍可能继续编造内容。在大语言模型的机制里,似乎默认要 “有问必答”。像 ChatGPT Search 虽然回答了全部 200 个新闻查询,但 “完全正确” 的比例只有 28%,“完全错误” 率却高达 57% 。
在这八款工具中,ChatGPT 还不是表现最差的。X 旗下的 Grok AI 表现堪称糟糕,其中 Grok-3 Search 的错误率竟然高达 94%。微软 Copilot 同样问题多多,200 次查询中有 104 次拒绝回答,剩下的 96 次里,“完全正确” 的仅有 16 次,“部分正确” 14 次 ,“完全错误” 多达 66 次,总体错误率接近 70%。
韩国国税厅官员提议修订《刑事诉讼法》,以强化对个人自持虚拟资产的扣押执行规则。今年...
2 韩国股市与纳斯达克100指数相关系数升至消息,据彭博社披露,韩国综合股价指数与纳斯达克100指数的60日相关系数升至0.46,接近过去...
3 Polymarket:美联储7月29日维持利率不变概率消息,Polymarket交易者目前预计美联储在7月29日的决策中维持利率不变的概率为93.5%。...
4 长鑫存储巨鲸挂出832万美元卖单,挂单规消息,长鑫存储巨鲸在HyperLiquid上挂出832万美元的卖单,挂单规模已超过CXMT单日成交额。当前...
5 BTC ETF两周吸引2.73亿美元资金消息,BTC交易所交易基金在两周内吸引了2.73亿美元的资金流入,尽管这一数字与此前八周流出...
6 Schwab新兴市场ETF与iShares全球ETF:哪个更适消息,Schwab新兴市场ETF与iShares全球ETF之间的对比引发了投资者的关注。Schwab ETF主要针对新兴经...
7 沉睡鲸鱼在5年后转移700枚BTC,当前价值约一只沉睡的鲸鱼在5年后转移了700枚比特币,最初购买时花费约2234万美元,目前价值约4530万美...
8 Zhu Su:石油或许是AI的最佳类比,最终将消息,三箭资本联合创始人Zhu Su表示,石油或许是AI的最佳类比,两者都存在多种形态并最终走...
9 币安将于7月21日停止支持MOVR和GLMR主网充消息,币安官方公告称,将于2026年7月21日19:00停止支持moonriver 和moonbeam 主网的充值和提现业务...
10 摩根士丹利:欧洲柴油供应紧缩压力或将消息,摩根士丹利指出,由于一系列重大供应挑战同时出现,欧洲正面临柴油供应紧缩局面,...
成都来彰科技 蜀ICP备2025134723号-1
资讯来源互联网,如有版权问题请联系管理员删除。