Context Sandbox

同一句提示词,为什么会有不同的“好回答”?

保持学生输入不变,公开改变任务场景和评价标准。这个沙盘演示的不是随机性,而是上下文如何定义“什么才算有用”。

CONTROL PANEL

保持学生输入不变

固定参数 · 显示场景层
选择 2—4 个任务场景

系统会公开叠加下方的任务说明,而不是假装相同输入会自动产生四种任务。

Visible Context Layers

模型实际看见了什么?

每个场景会把同一条原始提示词放进一个不同且可见的系统任务层。透明展示这一层,才能公平解释回答差异。

01
KNOWLEDGE

知识获取

公开的场景说明

把输入视为知识理解任务:解释核心概念、澄清边界,并使用适合大学生的例子。

生成结果

运行实验后在这里查看回答。

这类任务应该检查概念是否准确是否直接回应疑问例子是否帮助理解是否标出不确定信息
02
ANALYSIS

分析应用

公开的场景说明

把输入视为分析应用任务:识别问题、列出证据与假设、使用清晰框架推导结论。

生成结果

运行实验后在这里查看回答。

这类任务应该检查框架是否匹配问题证据与结论是否对应是否识别反例与限制推理是否可复核
03
CREATION

创意生成

公开的场景说明

把输入视为创意生成任务:给出彼此有差异的方向,避免套话,并说明每个方向的独特价值。

生成结果

运行实验后在这里查看回答。

这类任务应该检查方案差异是否真实是否跳出常见套路是否满足硬约束是否保留继续探索空间
04
POLISHING

语言修饰

公开的场景说明

把输入视为语言修饰任务:保持事实和原意,按指定受众与风格改善表达,并说明关键改动。

生成结果

运行实验后在这里查看回答。

这类任务应该检查原意与事实是否保留语气是否适配受众表达是否清晰自然改动是否可追踪
SCENE MATCH MATRIX

用不同场景标准重新观察这些回答

由学生手动触发。评分是 AI 场景匹配参考,不等同于事实准确性,也不要求对角线一定最高。

完成两到四类回答后生成矩阵。
比较时不要只问“哪段更长”

观察每段回答是否满足它所属场景的标准。适合知识解释的回答,不一定适合创意发散;能润色句子的模型,也没有自动获得分析证据。