一、核心思想:语言即策略的元编程框架

1.1 范式突破
Eureka不是简单的"LLM+RL"组合,而是建立自然语言到强化学习的编译通道,其本质是:
- 语言即奖励函数:将人类模糊的意图描述转化为精确的数学奖励函数
- 代码即策略:自动生成可执行的策略网络架构和训练代码
- 反思即进化:通过自我批判机制持续优化策略
1.2 技术范式演进
| 维度 | 传统RL | LLM提示RL | Eureka |
|---|---|---|---|
| 奖励设计 | 手工编码(耗时数周) | 静态模板生成 | 动态语义编译 |
| 策略架构 | 固定网络结构 | 预定义架构 | 任务自适应生成 |
| 训练效率 | 百万次环境交互 | 十万级交互 | 千次交互达专家水平 |
| 可解释性 | 黑箱决策 | 部分自然语言解释 | 全链路可追溯决策树 |
1.3 关键创新点
- 语义奖励编译器
- 将自然语言指令转化为多目标奖励函数:
- 将自然语言指令转化为多目标奖励函数:
- 神经架构搜索(NAS)引擎
- 根据任务复杂度自动生成策略网络:
简单任务 → 3层MLP 复杂操作 → 时空Transformer
- 根据任务复杂度自动生成策略网络:
- 反思优化器
- 基于训练日志的自我批判:
"抓取失败因接触面积不足" → 增加表面接触奖励项
- 基于训练日志的自我批判:
二、模型架构:语言到动作的编译流水线

2.1 整体架构图
自然语言指令 → [语义解析器] → [奖励函数生成器] → [策略架构搜索] → [RL训练引擎]
↑ ↑ ↑
[反思优化器] ← [训练日志分析] ← [环境交互]
2.2 语义解析器
多模态理解层:
- 语言图神经网络
- 构建指令的语义依存树:
"灵巧抓取易碎品" → {动作:抓取, 属性:灵巧, 约束:防碎}
- 构建指令的语义依存树:
- 物理常识嵌入
- 融合物理知识图谱:
"易碎品" → 最大受力阈值<5N
- 融合物理知识图谱:
- 不确定性量化
- 输出置信区间:
- 输出置信区间:
2.3 奖励函数生成器
分层奖励架构:
- 基础生存奖励


1235

被折叠的 条评论
为什么被折叠?



