斯坦福大学研究发现，AI聊天机器人ChatGPT的表现很不稳定_TBV

首页资讯中心财经频道娱乐频道体育频道房产频道教育频道科技频道行业频道

首页 > 汽车

斯坦福大学研究发现，AI聊天机器人ChatGPT的表现很不稳定

来源：IT之家时间：2023-09-08 22:48:08

(相关资料图)

IT之家 9 月 7 日消息，斯坦福大学的一项新研究发现，热门生成式人工智能（AI）聊天机器人 ChatGPT 的能力在几个月内有所波动。

斯坦福大学的团队评估了 ChatGPT 在几个月内如何处理不同的任务。他们发现，ChatGPT 的能力随时间的推移而出现了不一致。目前，ChatGPT 有两个版本 —— 免费的模型和更智能、更快速的付费 GPT-4 版本。研究人员发现，GPT-4 在 3 月份能够有效地解决数学问题，识别质数的准确率为 %。三个月后，其准确率下降到了 % 。而另一方面，却变得更好，从 % 的准确率提高到了 %。

研究人员还注意到，在编写代码和视觉推理方面也有类似的波动。斯坦福大学计算机科学教授 James Zou 称：“当我们调整一个大型语言模型来提高它在某些任务上的表现时，那可能会有很多意想不到的后果，可能会损害这个模型在其他任务上的表现…… 这个模型回答问题的方式有各种各样的相互依赖性，这可能导致我们观察到的一些恶化行为。”

研究人员认为，结果并不能真正反映 ChatGPT 性能的准确性状态，而是显示了微调模型带来的意外后果。本质上，当修改模型的一部分来改善一个任务时，其他任务可能会受到影响。为什么会这样很难确定，因为没有人知道 ChatGPT 是如何运作的，而且它的代码也不是开源的。

随着时间的推移，研究人员注意到，ChatGPT 的回答不仅变得不太准确，而且还停止了解释其推理过程。

由于 ChatGPT 的运作方式，要研究和衡量它的表现可能很困难，这项研究强调了观察和评估驱动 ChatGPT 等工具的大型语言模型（LLM）性能变化的必要性。该研究已经在 arXiv 上发布，并正在等待同行评审，IT之家附链接在此。

相关稿件

斯坦福大学研究发现，AI聊天机器人ChatGPT的表现很不稳定

“为早日住上好小区”：一老旧小区居民亲自清拆违建

口腔健康一点通|什么是智齿？智齿到底需不需要拔？一起来看看

厦门深挖潜力探索地下开发挺进城市第二空间

深圳圣达电梯有限公司虚假维保被罚款10000元

“法式”生活丨花12万元买的车位却无法停车遇到这种事你该咋办？

梅西自2018年1月至今任意球打进31球，点球也打进31球

我国秋粮陆续进入成熟期长势总体正常丰收有希望

诺基亚全键盘手机

“春风”吹进大巴山药谷

天津市奥林匹克中心游泳跳水馆免费对公众开放的通知

海南热带雨林国家公园霸王岭分局：维护雨林自然资源，保护生物多样性，助力生态产业发展

“金九”首周钢材库存延续去化终端拿货意愿不及往年同期

迎接“金九银十”旅游黄金季，武汉野生动物王国彩翼谷展示区开放

唐人神：8月生猪销售收入同比上升20.16%

北京提醒：双休日避免到山区、河道等区域活动

科普一下｜纸吸管中的PFAS有哪些潜在危害？

深圳普降极端特大暴雨，四项雨量记录破极值

慧博云通：余浩累计质押股数为1100万股

俄大使揭幕金砖国家钞票，统一货币即将到来，美金融霸权将被打破

重大战果！1207名缅北电诈嫌疑人移交我方

OLED概念走强冠石科技、华映科技涨停

武汉白癜风医院哪家好-导致头部白癜风的原因有哪些

首付80万起拥有上海3房!华二+世外+特斯拉+千亿产业=国企全新住宅2.5万/㎡!

美网-萨巴伦卡首盘吞蛋2-1逆转凯斯进决赛将与高芙争冠

展会活动|昇旸光学参加光博会取得圆满闭幕

羊守终章：决战狼首领（第二十五话、第二十六话）

政治学研究的时空动力学

蔚来想通了一半

俄罗斯联邦海关署大楼发生大火

汽车

“春风”吹进大巴山药谷

汽车

北京提醒：双休日避免到山区、河道

教育频道

深圳圣达电梯有限公司虚假维保被罚款10000元

羊守终章：决战狼首领（第二十五话、第二十六话）

四川行政复议质量提升年活动中期评估工作启动

直击暴雨袭粤：部分水浸地区水深及腰

现代汽车自清洁ADAS摄像头遭灰尘挡视线

教练让女学员陪睡?涉事驾校回应为保证考试过关被教练威胁！

迎接“金九银十”旅游黄金季，武汉野生动物王国彩翼谷展示区开放

暴雨来袭，在穗群众因灾导致基本生活困难的可申请临时救助

“双奥之城”艺术周百余活动打造文旅金名片

照亮滩区迁建村民回家路

四大行明确存量首套住房贷款利率调整事项

我国可再生能源装机十年增长约三倍

【东西问】芒果何以由热带果园飘香全世界？

新奥股份何祯圣：选择适合自身的衍生品

白云电器（603861）9月8日主力资金净卖出52.54万元

荣耀Magic V2拍照体验：折叠屏也可以成为影像旗舰

iPhone官网发布会：苹果又带来了哪些惊喜呢

北斗板块继续走高业内认为卫星通话将成旗舰机标配