前言
由于笔者没有人工智能方面的知识储备,所以本篇文章仅以普通人的视角使用和对比各个大语言模型,如有错误或纰漏,还望不吝指出。
本文使用chat3.5,谷歌的bard,讯飞星火三个平台,下文以首字母c,b,x简写名称。
测试以歧义理解,逻辑推断,文章生成三个角度来对比,以下结论均是笔者个人主观判断。
正文
歧义理解
问题
这台手术很成功,我失败的人生结束了。这句话什么意思
c
b
x

结论
很明显,bard的理解能力是远超于chat3.5和讯飞星火的,它更擅长于模仿人类的思维来理解问题。
逻辑判断
这里使用了一道经典的行测试题
甲、乙、丙三人各自举着红旗、绿旗和黄旗,分别从东面、南面和西面三个方向朝山顶攀登。甲不举红旗,也不从东面上山;举红旗的人从西面上山;乙举着绿旗。
由此可以推出( )。
A.举绿旗者从南面上山
B.丙从东面上山
C.举黄旗的不是甲
D.乙不从南面上山
c

b

x
总结
这道题只有bard的回答是正确的,chat3.5和讯飞的逻辑有很大问题,
例如chat回答的第三条:
”根据题目,甲不举红旗,因此甲举黄旗。所以举黄旗的不是甲“。
还有讯飞的第二条:
“乙举着绿旗。由于丙已经举了红旗,所以乙只能举黄旗“。
这些回答有严重的逻辑问题。
文章生成
问题
我有一个美妆产品,是适用于干皮的面霜,我想在小红书等平台上进行广告投放,请你帮我以小红书文案特点写一下文案
c

b

x
总结 都有不错的文本生成和模仿能力,但总的来说,bard还是与其他两个拉开了不小的差距
个人想法
目前星火大模型距离国外行业顶尖还是有一定的距离,目前差不多在chat3的水平,不过由于国内环境,市场并没有被国外大规模抢占,所以讯飞有很不错的市场机会和发展潜力,但目前来看,还是需要加速升级,目前gpt4,bing等模型都已经很成熟,任重道远。
本文通过对比chat3.5、谷歌bard和讯飞星火在歧义理解、逻辑推断和文章生成的任务中表现,发现bard在理解能力和逻辑推理上优于其他两者,尤其是在逻辑题解答上。文章生成方面,bard也展现出更出色的文本生成能力。尽管讯飞星火在国内市场有潜力,但需提升技术以追赶国际领先水平。

2260

被折叠的 条评论
为什么被折叠?



