说一个反常识的真相,Agent如今在真实工作场景的成功率依然很低
据评测,当前主流大模型在真实电商、生活等场景任务中表现远逊于编程领域。例如,在RealReplicaBench电商评测中,仅Claude Opus 5通过率刚过…
据评测,当前主流大模型在真实电商、生活等场景任务中表现远逊于编程领域。例如,在RealReplicaBench电商评测中,仅Claude Opus 5通过率刚过60%,多数模型不足50%。在AI的世界里,会解题,和会工作,中间确实还隔着一些比较遥远的距离。
原文链接: https://wallstreetcn.com/articles/3779598
insigtX 内容为资讯/教育性质,非投资建议。