淘天集团简介
淘天集团作为阿里巴巴旗下的核心电商平台,拥有全球最复杂的在线商业系统,服务数亿消费者、千万商家和百亿商品。在AI Agent优化方向,淘天集团依托阿里Qwen系列SOTA模型,构建了完整的数据构建、自动评测、训练优化到推理部署的一体化平台。团队专注于将生成式AI变为可落地、可复制的生产力,在真实电商场景中实现AI应用的规模化落地。
题目列表(10道)
题目1:如何提升Agent的Function Call能力?
题目描述:在实际应用中,Agent的Function Call能力直接影响任务执行效果。面试官会问:"如何提升Agent的Function Call能力?"
答案要点:
提升Function Call能力需要从多个维度入手。首先是Prompt Engineering,通过Few-shot示例、思维链(CoT)和结构化指令让模型理解函数调用逻辑。其次是Schema设计,定义清晰、完整的函数参数和返回类型,避免歧义。然后是上下文管理,保持对话历史中的函数调用记录,帮助模型理解调用时机。最后是错误处理机制,设计重试、降级和人工干预策略。
扩展提示:淘天电商场景中,Function Call需要处理复杂的业务逻辑,如商品查询、订单处理、用户画像更新等。实际应用中要结合业务规则和异常处理。
题目2:后训练方法(SFT/RLHF/DPO)的区别与应用场景
题目描述:"常见的后训练方法有哪些?它们的优缺点和区别是什么?在淘天电商场景中如何选择?"
答案要点:
SFT(监督微调)基于人工标注数据,适合基础能力对齐,但依赖数据质量。RLHF(人类反馈强化学习)通过人类偏好优化模型,能提升生成质量,但训练复杂、成本高。DPO(直接偏好优化)简化了RLHF流程,直接优化偏好数据,训练更稳定。
在淘天场景中,SFT用于基础电商知识对齐,RLHF用于优化客服对话质量,DPO用于快速迭代商品推荐策略。选择依据包括数据可用性、迭代速度和效果要求。
扩展提示:淘天拥有亿级在线反馈数据,可以构建数据飞轮,实现"业务-模型-反馈"的闭环迭代。

&spm=1001.2101.3001.5002&articleId=160191525&d=1&t=3&u=2ec204ecda3a491f9d246ef0f5df20ab)
675

被折叠的 条评论
为什么被折叠?



