手机浏览器扫描二维码访问
方法,这对于评估文本之间的相似程度至关重要。
了解清楚数据获取来源后,进行数据采集,数据采集的方法包括自动化和手动两种方式:
自动化采集:利用编写的Python脚本通过API接口自动从上述数据库和期刊中下载文献和元
数据,部分代码如图3.2所示。这种方法的优点是效率高,可以大量快速地收集数据。使用
BeautifulSoup和Requests库从开放获取的期刊网站爬取数据。
手动采集:通过访问图书馆、研究机构以及联系文章作者等方式获取不易自动下载的资源。虽
然此方法更费时,但有助于获取更全面的数据集,特别是一些最新或尚未公开的研究成果。
将两种方法采集到的文献数据进行汇总,最大范围的将有关电力LCA领域的英文文献进行汇
总,共获得507篇。
最后是将各个途径获取到的文献数据和元数据汇总,进行数据预处理。
采集到的数据需经过清洗和预处理,才能用于后续的分析。
数据预处理的步骤包括:
数据清洗:删除重复的记录,校正错误的数据格式,填补缺失值。
数据整合:将来自不同来源的数据整合到一个统一的格式和数据库中,如表3.1所示,以便进
行进一步的分析。
为了使后续知识库生成更加准确与完善,对文献具体内容进行筛选。例如部分文献中并未提到
所用数据,而是指出所用数据库链接,如图3.3所示,在对该篇文献进行解析后,数据部分就是欠
缺的,最终构建的知识库就不完整,在调用大模型回答相关问题时,极大概率产生幻觉。因此为了
构建更为准确的专业模型,对爬取下来的507篇文献进行筛选,选择包括流程图(system
boundaries)、各单元过程或生产环节的投入(input),产出(output),数据(lifecycle
inventory),以及数据的时间、地点、获取方法、技术细节的文献作为最后应用的数据。核对内容
后的文献数据集共98篇英文文献。
亲爱的,该吃药了!美丽纯洁的圣女,端来了治疗伤势的药剂。在这一天,他用双眼看到背叛,用灵魂体验到绝望从这一天起,勇者已死,有事烧纸!...
神秘少年闯花都,左手金针度世,右手长剑破敌,念头通达无拘束,赚钱泡妞两不误。敌人,斩杀!女神,推到!众多极品女神纷至沓来,芳心暗许。冷艳总裁泼辣警花美艳教师娇俏校花千金小姐妩媚护士陈飞宇我要开疆拓土,打下一个大大的后宫!...
父亲惨死,林易放弃挚爱的初恋入赘陈家,他发誓一定要爬到权力的巅峰,调查出当年的真相!...
我想要挨一顿毒打灾厄之剑旧世界守墓人调律师最后的天国捍卫者二十四个毁灭因素之一淮海路小佩奇深渊烈日最终的地狱之王槐诗。某一天,穷困潦倒的槐诗忽然发现自己捡来的金手指终于能用了只不过,这似乎并不是一件好事。为了赚钱和苟命,他一不小心踏入了这个危险世界。现境之外的边境,日常之后的异常。...
老兵朱高远,穿越成为吊死煤山的崇祯皇帝。凭借熟知的历史知识及高超的战术指挥能力,率领千余残部成功的从朝阳门溃围而出。继而出人意料转进燕山,躲过流贼大军追剿。继而设计兼并了吴三桂派去劫驾的一千夷丁。一片石大战爆发后,又率领两千明军长驱南下。流贼惨败退出北京,建奴南下,朱高远凭借着结硬寨打呆仗的战术死守黄淮防线。...
穿书爆笑沙雕老六们不说自己有读心术团宠没素质前期疯癫文学he殷娇穿书十年,终于在某一天,觉醒了她穿到一本可歌可泣的爱情故事里,男女主之间的故事一千多章,全员没嘴是狗听了都摇头的程度好消息女主是她姐,结局he坏消息她家被抄了,全死光光了从此,殷娇为了改变书里的结局可谓是绞尽脑汁煞费苦心片段一失踪多年的女主长姐回家,殷娇带领一众人给足了自己姐姐排面我为我姐举大各位书友要是觉得炮灰觉醒,一群老六偷听我心声还不错的话请不要忘记向您QQ群和微博里的朋友推荐哦!...