PromptHive:通过协作提示工程将主题专家重新置于教育内容创作的前沿
作者
研究背景与问题
-
作者发现了哪些问题或挑战?
随着大规模语言模型(LLMs)的普及,生成高质量的教育内容变得更为可能。然而,如何在内容创作中有效地融合主题领域专家(Subject Matter Experts, SMEs)的专业知识,确保输出内容的准确性和适用性,是一个重要挑战。此外,设计支持快速迭代和实验的界面以帮助专家优化提示工程(prompt engineering)也是一项需要解决的问题。 -
为什么这个问题很重要?
当前研究已经证明,领域专家在指导LLM输出以生成专业内容方面的重要性。教育领域是AI应用最具潜力的场景之一,通过优化提示工程可提升教育内容的质量、加速内容创作过程,同时保留领域专家的控制权和信任感。 -
研究动机与相关工作
作者之前的研究揭示了提示工程的复杂性及其对大语言模型输出质量的影响,同时指出生成式AI工具的不可预测性和提示设计的高元认知需求。此外,领域专家和协作式提示迭代的结合性在现有文献中尚未充分探讨。
解决方案
-
作者提出了哪些方法或解决方案?
作者设计了一个协作式提示创作界面——PromptHive,用于连接领域知识与生成式AI,支持快速迭代和提示优化。
PromptHive采用四阶段工作流:加载教材数据、创作和迭代提示、共享有效提示,并结合课本级别及课程级别的多层次提示设计,实现生成内容的高度适配性。 -
该解决方案的创新之处是什么?
- 与传统提示工程工具不同,PromptHive深度嵌入专家的现有工作流程,利用随机化按钮和“提示草稿板”为快速实验提供支持。
- 提供“共享提示库”,促进协作式提示设计,支持SMEs跨课程借鉴和贡献想法。
- 内置后端日志记录引擎,用于捕获用户如何在协作式迭代过程中演变提示,为研究领域带来“动态提示迭代”的新视角。
-
实施步骤是什么?使用了哪些关键技术?
- 加载教材内容:通过链接导入结构化数据源。
- 创作和试验提示:使用提示草稿板生成多种提示版本并执行模型输出试验。
- 优化和迭代:通过比较不同版本的提示及其输出快速调整内容。
- 共享有效提示:通过“提示库”保存最佳设计,供其他专家使用和优化。
PromptHive还支持GPT-4的结构化输出,结合自一致性提示技术减少AI生成内容中的不一致性。
研究成果
-
取得了哪些具体成果?
- 在数学领域,PromptHive显著减少了专家的认知工作负担(NASA-TLX评分从55.17降至26.73),并将有用内容生成所需时间从“几个月”缩短到“几小时”,效率提升约30倍。
- 平均系统可用性评分(SUS)为89/100,显示出高水平的用户满意度和信任度。
-
与现有解决方案相比,它有哪些优势?
- PromptHive使非AI专家能够创建与手工内容质量相匹配的内容,同时大幅降低劳动投入。
- 通过协作,SMEs在共享与定制提示过程中体现出更强的创造性与更低的认知负担。
-
实验或评估结果是什么?
- 学习增益实验表明:使用PromptHive生成的提示在学习效果上与人类手动撰写内容同样有效(平均学习增益分别为8.13%和7.47%,统计学无显著差异)。
- 与手动提示相比,PromptHive所需时间显著减少,且重复工作频率降低。
-
局限性与未来方向
- PromptHive的提示生成质量依赖于基础模型(如GPT-4),存在偏见、幻觉等风险,需要慎重部署于大规模教学场景。
- 尽管专家认为PromptHive保留了领域控制权,未来可扩展其功能以支持对生成内容的直接编辑,同时尝试增加专家对“系统级提示”设计的参与。
- 当前研究主要集中在数学领域,未来可探索其适用于其他学科及教育系统乃至其他领域应用的潜力。
总结
PromptHive是一种开创性的协作式提示工程工具,在专家保持高度控制的情况下,将AI用于快速、高质量教育内容创作。它通过协作优化提示迭代过程并显著提升工作效率,展示了人类与生成式AI合作的新模式,同时为设计“人类中心且高自动化”的教育工具提供了参考路径。未来研究可通过扩展学科适用性及专家参与深度进一步优化系统功能与应用场景。
研究问题 / 现实痛点
这篇论文在当前问题库中对应的问题线索。
研究问题
3- 如何将领域专家的知识有效地整合到生成式AI的内容创作流程中?分类: LLM学习支架与反思支持同类问题arrow_forward
- 如何设计支持快速迭代和试验的界面,帮助领域专家优化提示工程?分类: LLM学习支架与反思支持同类问题arrow_forward
- PromptHive能否显著降低领域专家的认知负荷并提高教育内容生成的效率?分类: LLM学习支架与反思支持同类问题arrow_forward
现实痛点
1- 领域专家难以高效参与AI生成教育内容,提示设计耗时且复杂。分类: LLM学习支架与反思支持同类问题arrow_forward
- 67%
AutoPBL:一个由大型语言模型支持的平台,引导和支持个人学习者通过自我项目式学习
CHI '25· 大语言模型(LLM)的人机协作 +2
- 60%
计算交互:理论与实践
CHI '18· 编程教育与计算思维 +1
- 60%
建立实践社区以支持全球人机交互教育
CHI '18· 编程教育与计算思维 +1
- 60%
Cody:基于AI的系统,用于定性研究的半自动化编码
CHI '21· 大语言模型(LLM)的人机协作 +1
- 60%
PaperWeaver: 通过将推荐论文与用户收集的论文结合来丰富主题论文警报
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
CodeAid:评估基于LLM的编程助手在课堂部署中平衡学生和教育者需求的情况
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
对大型语言模型在学术文献理解和评审方面的评估:一项针对初级学者的实证研究
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
理解大型语言模型在个性化和构建策略以对抗学术拖延中的作用
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
教AI如何编码:使用大型语言模型作为可教学代理进行编程教育
CHI '24· 大语言模型(LLM)的人机协作 +1
- 60%
装傻以求聪明:在大学计算机科学课程中创建和评估基于LLM的教学代理
CHI '25· 大语言模型(LLM)的人机协作 +1
基于研究子主题与职业分类的 Jaccard 相似度(≥60%)