环境科学家面临着日益严峻的挑战:研究比以往任何时候都多,但许多有用的信息分散在论文、表格、图表和不一致的报告格式中。一项新的评论表明,大型语言模型(LLM)可以帮助研究人员组织这些分布式证据,只要他们的结果得到跟踪、验证并接受同行评审。
该分析发表在《人工智能与环境》上,探讨了法学硕士如何通过三个相关任务支持环境研究:系统文献筛选、关系知识挖掘和定量数据挖掘。这些方法共同有助于将非结构化科学文献转化为可在数据库、模型、风险评估和环境决策中重复使用的结构化信息。
“大型语言模型有可能减少组织生态证据所需的手工工作量,但它们最大的价值在于帮助专家,而不是取代他们,”南京大学的主要作者郭靖说。 “可靠的程序需要明确的任务定义、结构约束、可追溯的证据和人工验证。”
最有前途的应用之一是文献综述。环境审查可能包含数千份文件,涉及污染物、生态系统、暴露途径、毒理学效应和处理技术。法学硕士可以解释上下文、识别同义词和歧义表达,并同时应用多个纳入标准。在一项同行评审的研究中,GPT-4 在测试大约 12,000 条记录时实现了 100% 的召回率,并在适当的阈值下将手动测试时间减少了大约 50%。然而,作者强调,关于是否应纳入研究的最终决定应由人类评审员决定。
法学硕士还可以帮助研究人员发现隐藏在学术文本中的关系。其中包括污染源与暴露之间的关系、化学品与毒理学效应之间的关系、以及处理条件与污染物去除效率之间的关系。模型不是简单地识别单个术语,而是可以帮助将这些连接组织成关系网络、知识图和其他结构化资源。
第三种选择是定量数据挖掘。环境文件包括各种浓度、毒性终点、降解率、去除效率和实验条件。法学硕士可以帮助将这些分散的值恢复为完整的记录,以维护化学品、条件、测量、单位和证据来源之间的关系。多模态模型甚至可以从数字重建数据,尽管评论警告说数字的解释不可靠,仍然需要仔细验证。
作者强调,完全自动化并不是目标。 LLM 输出可能包含不正确的数字、不一致的单位、不受支持的关系或缺少上下文。更实用的工作流程将模型挖掘与规则验证和专家评审结合起来。
展望未来,审查要求制定针对具体任务的标准,加强与环境数据库和本体的整合,改进源头跟踪以及标准化评估方法。作者得出的结论是,法学硕士作为协作工具最有用,可以帮助学者浏览快速扩展的文献,同时保持学术质量和责任感。
===
期刊参考文献:Li Y;郭杰;史文.环境研究的大语言模型:系统文献综述、关系知识挖掘和定量数据挖掘。人工智能环境。 2026,1(3):xx-xx。数字编号: 10.66178/aie-0026-0019
https://www.the-newpress.com/aie/article/doi/10.66178/aie-0026-0019
===
关于杂志:
人工智能与环境 是一个国际多学科平台,用于交流环境科学和人工智能(AI)交叉领域的基础和应用研究成果。它致力于为全球地球与环境科学、大数据科学和人工智能跨学科领域的研究人员提供一个创新、有效和专业的平台,展示这个快速发展的科学领域的研究成果。它是一本经过同行评审的开放获取期刊,发表批判性评论、原创研究、紧急通讯、观点、评论和观点文章。
/ 公开公告。来自原始组织/作者的材料可能会为了清晰度、风格和长度而进行更新和编辑。 Mirage.News 没有任何机构隶属关系或隶属关系,本文表达的所有观点、立场和结论仅代表作者的观点、立场和结论。完整内容请参见此处。