探索性扩散模型

方法概览图,展示探索性策略模型从理论动机出发,经无奖励预训练到微调的流程。

科学方法概览图,采用克制的矢量风格,包含三维策略空间图、预训练经验回放缓冲区和微调面板。
使用此提示词开始

方法概览图,展示探索性策略模型从理论动机出发,经无奖励预训练到微调的流程。

体验 Kimi Design
为机器学习方法章节开篇设计一张由科学可视化设计师制作的方法概览图。说明探索性策略模型从理论动机、无奖励预训练到下游微调的工作流程。内容须保持匿名,仅限通用学术概念和符号,不标注来源。

采用适合跨双栏的单页横向版式。画面应宽而紧凑,可直接嵌入论文。依次呈现三个连续部分,标注为 (a)、(b) 和 (c),并配备清晰易读的标题、坐标轴标签、数学符号和必要注释。

部分 (a):绘制三维策略空间图,包含三条坐标轴、半透明三角网格可行区域、由实线连接的绿色策略点,以及一个红色目标点。使用简短引线标注确定性策略和最大状态熵策略,并给出简要理论结论。用一条粗红色箭头将 (a) 连接至 (b)。用标题为“探索性扩散模型”的蓝色圆角虚线边框框住 (b) 和 (c);将 (b) 标题设为“预训练”。加入一个圆角经验回放缓冲区,内含横向排列的轨迹缩略图,并搭配红色机器人、灰色机器人和地球图标,分别表示扩散模型、高斯策略和无奖励环境。用黑色实线箭头连接图标;让环境回环连接至缓冲区,并标注交互、行为采集和经验存储。将 (c) 设计为浅色圆角“微调”面板,展示高斯策略和扩散策略,各自配有概率密度曲线、下游任务框和醒目的红色提升箭头。策略名称旁保留 π_g 和 π_d;为相关图标、箭头和曲线添加直接的语义标签。

以白色为底,点缀克制的深蓝、红色和绿色,并使用浅灰和淡米色填充。采用细而精确的线条与克制的矢量风格,适合学术论文。保留坐标名称、直接标签、公式和子图标签;装饰和署名仅限科学内容。
中性边框颜色

将 (b) 和 (c) 周围的虚线边框从蓝色改为灰色;其余保持不变。

体验 Kimi Design
为机器学习方法章节开篇设计一张由科学可视化设计师制作的方法概览图。说明探索性策略模型从理论动机、无奖励预训练到下游微调的工作流程。内容须保持匿名,仅限通用学术概念和符号,不标注来源。

采用适合跨双栏的单页横向版式。画面应宽而紧凑,可直接嵌入论文。依次呈现三个连续部分,标注为 (a)、(b) 和 (c),并配备清晰易读的标题、坐标轴标签、数学符号和必要注释。

部分 (a):绘制三维策略空间图,包含三条坐标轴、半透明三角网格可行区域、由实线连接的绿色策略点,以及一个红色目标点。使用简短引线标注确定性策略和最大状态熵策略,并给出简要理论结论。用一条粗红色箭头将 (a) 连接至 (b)。用一个蓝色圆角虚线边框框住 (b) 和 (c),标题为“探索性扩散模型”;将 (b) 标题设为“预训练”。加入一个圆角经验回放缓冲区,内含横向排列的轨迹缩略图,并搭配红色机器人、灰色机器人和地球图标,分别表示扩散模型、高斯策略和无奖励环境。用黑色实线箭头连接图标;让环境回环连接至缓冲区,并标注交互、行为采集和经验存储。将 (c) 设计为浅色圆角“微调”面板,展示高斯策略和扩散策略,各自配有概率密度曲线、下游任务框和醒目的红色提升箭头。策略名称旁保留 π_g 和 π_d;为相关图标、箭头和曲线添加直接的语义标签。

以白色为底,点缀克制的深蓝、红色和绿色,并使用浅灰和淡米色填充。采用细而精确的线条与克制的矢量风格,适合学术论文。保留坐标名称、直接标签、公式和子图标签;装饰和署名仅限科学内容。
添加第二个目标点

策略空间中显示两个红色目标点,而非一个;图中其余部分保持不变。

体验 Kimi Design
为机器学习方法章节开篇设计一张由科学可视化设计师制作的方法概览图。说明探索性策略模型从理论动机、无奖励预训练到下游微调的工作流程。内容须保持匿名,仅限通用学术概念和符号,不标注来源。

采用适合跨双栏的单页横向版式。画面应宽而紧凑,可直接嵌入论文。依次呈现三个连续部分,标注为 (a)、(b) 和 (c),并配备清晰易读的标题、坐标轴标签、数学符号和必要注释。

部分 (a):绘制三维策略空间图,包含三条坐标轴、半透明三角网格可行区域、由实线连接的绿色策略点,以及一个红色目标点。使用简短引线标注确定性策略和最大状态熵策略,并给出简要理论结论。用一条粗红色箭头将 (a) 连接至 (b)。用标题为“探索性扩散模型”的蓝色圆角虚线边框框住 (b) 和 (c);将 (b) 标题设为“预训练”。加入一个圆角经验回放缓冲区,内含横向排列的轨迹缩略图,并搭配红色机器人、灰色机器人和地球图标,分别表示扩散模型、高斯策略和无奖励环境。用黑色实线箭头连接图标;让环境回环连接至缓冲区,并标注交互、行为采集和经验存储。将 (c) 设计为浅色圆角“微调”面板,展示高斯策略和扩散策略,各自配有概率密度曲线、下游任务框和醒目的红色提升箭头。策略名称旁保留 π_g 和 π_d;为相关图标、箭头和曲线添加直接的语义标签。

以白色为底,点缀克制的深蓝、红色和绿色,并使用浅灰和淡米色填充。采用细而精确的线条与克制的矢量风格,适合学术论文。保留坐标名称、直接标签、公式和子图标签;装饰和署名仅限科学内容。
修改模型框标题

将虚线框名称从探索性扩散模型改为探索性策略模型;其余保持不变。

体验 Kimi Design
为机器学习方法章节开篇设计一张由科学可视化设计师制作的方法概览图。说明探索性策略模型从理论动机、无奖励预训练到下游微调的工作流程。内容须保持匿名,仅限通用学术概念和符号,不标注来源。

采用适合跨双栏的单页横向版式。画面应宽而紧凑,可直接嵌入论文。依次呈现三个连续部分,标注为 (a)、(b) 和 (c),并配备清晰易读的标题、坐标轴标签、数学符号和必要注释。

部分 (a):绘制三维策略空间图,包含三条坐标轴、半透明三角网格可行区域、由实线连接的绿色策略点,以及一个红色目标点。使用简短引线标注确定性策略和最大状态熵策略,并给出简要理论结论。用一条粗红色箭头将 (a) 连接至 (b)。用蓝色圆角虚线边框框住 (b) 和 (c),标题为“探索性扩散模型”;将 (b) 标题设为“预训练”。加入一个圆角经验回放缓冲区,内含横向排列的轨迹缩略图,并搭配红色机器人、灰色机器人和地球图标,分别表示扩散模型、高斯策略和无奖励环境。用黑色实线箭头连接图标;让环境回环连接至缓冲区,并标注交互、行为采集和经验存储。将 (c) 设计为浅色圆角“微调”面板,展示高斯策略和扩散策略,各自配有概率密度曲线、下游任务框和醒目的红色提升箭头。策略名称旁保留 π_g 和 π_d;为相关图标、箭头和曲线添加直接的语义标签。

以白色为底,点缀克制的深蓝、红色和绿色,并使用浅灰和淡米色填充。采用细而精确的线条与克制的矢量风格,适合学术论文。保留坐标名称、直接标签、公式和子图标签;装饰和署名仅限科学内容。