Daniel S Brown 最新论文
Bobu 等人提出 SIRL 方法,通过让用户标注行为相似性来学习奖励函数表示,在模拟和用户实验中证明该方法比自监督学习更能泛化到新环境。
https://hci.top/zh/authors/33252?source=all