AI探索指南
🤖️今天的hacker news第2个热点非常有意思:)值得大家一看: LMSYS Org这个组织最近开放了Chatbot 领域的“混聊大内斗”,并每周都公开排行榜。 ⚔️竞技模式:他们把所有授予他们API接口的模型放到一块,每个模型随机匹配到与其它模型进行聊天对话。这些对话采用的是自然语言,而不是预定义的对话集合。在每次对话结束后,旁观的用户、开发者等等可以对两个参与对话的模型进行投票,以表达他们对这两个模型表现的偏好。 投票是匿名的,每个用户只能对同一对话投一次票。投票结果被用来计算 Elo 评分,Elo…
4)孩子还在成长中:目前提供的 PaLM 2 的多语言能力有限,且提供的 PaLM 2 的推理能力不尽如人意
(团队还分别计算了所有模型在仅考虑英语对话和仅考虑非英语对话时的 Elo 分数,如图 3 所示。结果在非英语排行榜上,PaLM 2 排名第 16)

——————————
团队补充的观察

1)Small Moders更具有竞争力:团队观察到一些较小的模型,包括 vicuna-7B 和 mpt-7b-chat,在排行榜上取得了高分。与参数翻倍的较大模型相比,这些较小的模型表现优异。他们推测高质量的预训练和微调数据集比模型大小更为关键。

而对于更复杂的推理任务或智力问答上,较大的模型仍可能表现更好。因此,在预训练和微调阶段策划时,高质量数据集似乎是在保持模型质量高的同时减小模型大小的关键方法。
 
 
Back to Top