Rohin Shah 最新论文
Bobu 等人提出 SIRL 方法,通过让用户标注行为相似性来学习奖励函数表示,在模拟和用户实验中证明该方法比自监督学习更能泛化到新环境。
https://hci.top/zh/authors/23843?source=all