使用非专业方法对目前主流llm模型对比以及思考

本文通过对比chat3.5、谷歌bard和讯飞星火在歧义理解、逻辑推断和文章生成的任务中表现,发现bard在理解能力和逻辑推理上优于其他两者,尤其是在逻辑题解答上。文章生成方面,bard也展现出更出色的文本生成能力。尽管讯飞星火在国内市场有潜力,但需提升技术以追赶国际领先水平。

前言

        由于笔者没有人工智能方面的知识储备,所以本篇文章仅以普通人的视角使用和对比各个大语言模型,如有错误或纰漏,还望不吝指出。

        本文使用chat3.5,谷歌的bard,讯飞星火三个平台,下文以首字母c,b,x简写名称。

        测试以歧义理解,逻辑推断,文章生成三个角度来对比,以下结论均是笔者个人主观判断。


正文

        歧义理解

                问题

                这台手术很成功,我失败的人生结束了。这句话什么意思

c

b

 x

        结论

        很明显,bard的理解能力是远超于chat3.5和讯飞星火的,它更擅长于模仿人类的思维来理解问题。


逻辑判断

        这里使用了一道经典的行测试题

甲、乙、丙三人各自举着红旗、绿旗和黄旗,分别从东面、南面和西面三个方向朝山顶攀登。甲不举红旗,也不从东面上山;举红旗的人从西面上山;乙举着绿旗。

由此可以推出( )。

A.举绿旗者从南面上山

B.丙从东面上山

C.举黄旗的不是甲

D.乙不从南面上山

c

b

x        总结

        这道题只有bard的回答是正确的,chat3.5和讯飞的逻辑有很大问题,

        例如chat回答的第三条:

                ”根据题目,甲不举红旗,因此甲举黄旗。所以举黄旗的不是甲“。

        还有讯飞的第二条:

                “乙举着绿旗。由于丙已经举了红旗,所以乙只能举黄旗“。

        这些回答有严重的逻辑问题。


文章生成

问题

        我有一个美妆产品,是适用于干皮的面霜,我想在小红书等平台上进行广告投放,请你帮我以小红书文案特点写一下文案

c

b

x

总结 都有不错的文本生成和模仿能力,但总的来说,bard还是与其他两个拉开了不小的差距


个人想法

        目前星火大模型距离国外行业顶尖还是有一定的距离,目前差不多在chat3的水平,不过由于国内环境,市场并没有被国外大规模抢占,所以讯飞有很不错的市场机会和发展潜力,但目前来看,还是需要加速升级,目前gpt4,bing等模型都已经很成熟,任重道远。

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值