开云kaiyun官方网站从东谈主机交互角度登程-开yun云体育入口(官方)网站/网页版登录入口/手机版最新下载
发布日期:2026-08-17 04:33 点击次数:91
(来源:DeepTech深科技)开云kaiyun官方网站
AI 对都(AI alignment)是现在大模子历练与优化过程中不能或缺的依次,现在平庸使用的格局包括基于东谈主类反馈的强化学习(RLHF,Reinforcement Learning from Human Feedback)和平直偏好优化(DPO,Direct Preference Optimization),都需要采集高质地的东谈主类偏好反馈数据。可是,现存界面条件标注者平直对比长篇文本,这种样子在领略上具有挑战性,非凡是当文本较长或实质不老练时,用户时时无法缜密地阅读、挂牵悉数实质以及识别文本中的悉数各异,导致反馈质地不高,从而影响到 AI 对都的质地。
(来源:尊府图)
现在尚未有议论提议如何系统地改善这类反馈质地。在近期一项议论之中,东谈主机交互学者史图画博士从用户反馈的角度进行张开,但愿惩办的中枢问题是:
• 如何晋升东谈主类反馈(非凡是长篇文本比拟场景)的准确性和质地?
• 如何减少用户在提供反馈过程中的领略职守和出错率?
为此,他和所在团队提议并给与了“剖析原则”[2],这是指将复杂的问题剖析成更小、更容易判断的单一信息点,分散对每个构成部分进行判断,然后将各构成部分的预测联结起来,得出最终预测驱散。这种格局旨在简化复杂任务为, 在处理省略情趣或复杂情况时非凡有用,从而提高反馈质地。
据先容,本议论基于剖析原则提议了 DxHF 的格局,通过“交互式剖析”的样子改善东谈主类提供反馈的过程。具体恶果包括:
• 交互式剖析技艺:将长篇文分内解成直快易读的单个显露,粗拙用户快速浏览和对比。
• 视觉援手用户界面:通过对每个显露信息进行联系性评分,并以视觉不透明度编码凸起重点信息,同期聚积语义相通的显露信息,匡助用户快速识别要津各异。
(来源:尊府图)
实验中的要津发现包括:DxHF 显赫提高了用户反馈的准确性(平均提高约 5%),非凡是在用户对判断驱散省略情时,准确性晋升更明显(约 6.4%);固然稍稍加多了反馈用时,但能灵验提高有计算信心并镌汰用户领略职守。
据先容,通盘议论过程不错分为三个主要阶段:
第一阶段包括议论问题界说与表面格局探索。议论团队对大模子对都中采集高质地反馈数据辛劳的问题进行了深化的文件总结和需求分析,从东谈主机交互角度登程,明确提议要探索一种新式用户界面技艺,以镌汰用户的领略职守,晋升反馈质地。在详情议论地点之后,议论团队查阅大批援手东谈主类有计算的联系文件,定位到了有助于东谈主们作出愈加准确的判断的“剖析原则”。受此启发,议论团队提议将文分内解为颓落的、易于相识的精真金不怕火显露信息,从而使反馈的比拟过程变得愈加容易掌持。
第二阶段为技艺罢了与界面想象。基于剖析原则,议论团队通过反复的里面参议、原型想象与迭代,测试了一系列交互界面。这一阶段波及到大批具体的想象有计算,比若是何准确地将长句剖析为单一的语义单位,如何凸起浮现最要津的部分,以及如何将两组相通文本之间的语义筹办直不雅呈现出来。在珍重插足实验前,团队也进行了大批的想象尝试、前期预研与消融实验测试,但愿明晰又不失合座性地呈现完好的剖析信息。
(来源:尊府图)
第三阶段为技艺仿真与实验考证。在插足珍重的用户实验之前,议论团队通过仿真对技艺进行评估。仿真过程中使用 AI 来模拟果然用户,通过调理 AI 用户的“感性进度”,议论东谈主员明晰地看到了剖析技艺在不同有计算智力用户中起到了积极的作用。随后议论团队实验了一项大范围的在线众包实验,超越 160 名参与者通过蚁集众包平台参与,提供果然的反馈数据。议论东谈主员从众包实验数据中不雅察到明显的效果:DxHF 不仅显赫提高了用户的反馈准确性,也匡助用户晋升了有计算信心。
在想象参议过程中,技俩面对如何同期兼顾文本合座性的相识与细节性的分析的问题。最终的想象灵感来自于一次接洽会上桌边的折叠宣传手册,他们发现不错通过折叠与拉伸的格局展示信息。于是,该团队借用该物理交互的隐喻来想象界面,不仅保留了合座阅读的完好性,也让用户不错解放地深化细节。在开展用户实验时,议论团队非凡属意到参与者对这一想象的反馈。参与者反馈了我方关于反馈中解放选用比拟样子的偏好,对精真金不怕火的问题比拟无需张开细节减少了强大的信息负荷,而对复杂比拟任务通过张开约略解放地探索更深档次的信息。
(来源:尊府图)
审稿东谈主以为本议论所矜恤问题与现时 AI 范围矜恤的热门具有很强的联系性,其指出议论团队从东谈主机交互的视角源流,探索如何缓解东谈主类在 AI 对都过程中所面对的复杂领略任务,并以为该地点特别具有出路。同期,审稿东谈主以为本议论提议的格局不仅对 AI 对都中高质地数据标注这一具体问题具有迫切孝敬,对长篇文本对比任务中东谈主所面对的领略挑战方面具备更平庸的应用后劲,约略进一步拓展至其他需要用户快速作念出多文本对比判断的场景,诸如法律文告比对、战略比拟等信息检索和有计算援手范围中进展作用,这些范围均对文本的缜密比对提议了极高条件。
展望该格局不错平庸用于矫正现在面向 AI 对都的东谈主类反馈数据采集历程,匡助构建更可靠、更合适东谈主类偏好的大说话模子。另据悉,该项倡导论文被用户界面软件与技艺接洽会(UIST,User Interface Software and Technology)2025 领受,据了解 UIST 是是东谈主机交互范围的顶会之一,将于 2025 年 9 月于韩国釜山召开,该会议地点主要聚合在用户界面软件与硬件技艺的革命。
图 | 史图画(来源:sdq.github.io)
本次论文的作家史图画博士现在接事于英国剑桥大学工程系,担任副议论员(博士后),从事东谈主智交互(Human-AI Interaction)的议论。此前,他曾接事于芬兰东谈主工智能中心,博士毕业于同济大学,本科毕业于华东师范大学。他的议论发奋于“让 AI 更懂东谈主”,包含对东谈主类行径狡计建模与 AI 的交互式对都。其学术恶果屡次赢得东谈主机交互与可视化范围顶级会议 CHI2025、CHI2024、PacificVis24 等最好论文提名奖。
他与芬兰 Aalto 的 Antti Oulasvirta 栽植和瑞典 KTH 的 Tino Weinkauf 栽植构成的议论团队在东谈主智交互范围始终互助,在该议论之前他们也曾积蓄了一系列面向机器东谈主范围的交互式 AI 对都议论责任,包括通过交互式退换奖励函数来截止 Agent 的算作行径 [2],以及愚弄档次分组可视化技艺晋升 AI 对都的效能 [3]。此次责任的重点则是但愿将交互式 AI 对都的责任从机器东谈主范围彭胀到大模子的应用中。
(来源:尊府图)
图 | 愚弄档次分组可视化技艺晋升对都的效能 [4](来源:尊府图)
与此同期,本次议论技俩是他在瑞士苏黎世联邦理工议论造访时代完成的,互助方的是 Mennatallah El-Assady 栽植与程富瑞博士。Mennatallah El-Assady 栽植和程富瑞博士在交互式机器学习和可讲授性机器学习,尤其是在大模子的交互式文分内析上有着大批的议论积蓄,此次互助将两边团队的上风加以灵验联结,收效地将交互式 AI 对都用于了大模子的文分内析。
参考尊府:
1.Shi, Danqing, Furui Cheng, Tino Weinkauf, Antti Oulasvirta, and Mennatallah El-Assady. DxHF: Providing High-Quality Human Feedback for LLM Alignment via Interactive Decomposition. To appear in UIST 2025.
2.Scott Armstrong, William B Denniston Jr, and Matt M Gordon. 1975. The use of the decomposition principle in making judgments.Organizational behavior and human performance14, 2 (1975), 257–263.
3.Shi, Danqing, Shibei Zhu, Tino Weinkauf, and Antti Oulasvirta. Interactive Reward Tuning: Interactive Visualization for Preference Elicitation. In 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pp. 9254-9261. IEEE, 2024.
4.Kompatscher开云kaiyun官方网站, Jan, Danqing Shi, Giovanna Varni, Tino Weinkauf, and Antti Oulasvirta. Interactive Groupwise Comparison for Reinforcement Learning from Human Feedback. arXiv preprint arXiv:2507.04340 (2025).
