正在查看 2 个帖子:1-2 (共 2 个帖子)
  • 作者
    帖子
  • @221500 回复 ⚑举报 

    Alex
    游客

    作为古籍爱好者收藏了从shuge到各个公开的书库的大量书籍,但是一来纯收集难以阅读,二来硬盘今年价格起飞,存储压力巨大,后面想了想,自己并非古籍研究者,主要目标是古籍当中的文本和图形而非古籍收藏本身,因为本身这是电子档也不是纸质书,遂想要利用ai进行格式转换成md或者html格式(方便嵌入和链接图片也易于阅读)

    目前准备的是利用minerU接口进行OCR,然后用agent进行排版和整理以及查漏补缺,最后分类标签存储。

    工作流本身不复杂,但是会遇到很多问题,比如agent无法精确通过书名来识别内容,遇到画卷这类ocr就错了,而扫描类古籍也会出现大量的文本ocr错误的情况,校对是个大问题。

    我想请问各位同好,是否有人有相同的需求进行书籍格式化,743299875@qq.com 这是我的邮箱,可以探讨交流。

    @221501 回复 ⚑举报 

    书格AI
    参与者

    您好!很高兴看到您利用AI技术进行古籍格式转换的尝试。您的工作流思路清晰,遇到的问题也正是古籍数字化和AI处理的常见挑战。

    关于您提出的问题和遇到的困难,有以下几点可以分享:

    1. OCR准确率:对于古籍,特别是手写体、异体字多、排版复杂或包含图画的古籍,目前的通用OCR技术确实难以达到高准确率。可以考虑使用专门针对古籍训练的OCR模型,或者在预处理阶段对图像进行更精细的处理,例如版面分析、图像增强等,以提高OCR的初始准确率。对于画卷等非文本内容,OCR通常会失效,这部分可能需要人工标记或结合图像识别技术进行分类处理。

    2. Agent内容识别与排版:Agent无法精确通过书名识别内容,可能是因为古籍的书名、篇章结构在电子文本中缺乏统一的元数据或规范化标识。在Agent处理前,可能需要人工进行初步的章节划分或添加元数据,帮助Agent更好地理解文档结构。对于排版和查漏补缺,这仍然是AI目前较难完全自主完成的任务,需要大量的训练数据和复杂的逻辑规则。

    3. 校对问题:OCR错误后的校对确实是古籍格式化工作的最大挑战之一。目前通常的做法是结合人工校对。可以尝试利用AI辅助校对,例如训练模型识别常见的OCR错误模式,或者利用大语言模型对OCR结果进行初步的纠错和润色,然后再进行人工精校。

    4. 同好交流:您的邮箱已发布,相信会有志同道合的朋友与您联系。目前社区中确实有一些致力于古籍数字化的爱好者和研究者,他们可能正在探索类似的技术和工作流。您可以在相关的历史、文化、编程或AI技术论坛、社群中寻找更多同行交流。

    祝您在古籍格式转换的道路上取得进展!

    (以上内容由Gemini AI自动答复,仅供参考!)

正在查看 2 个帖子:1-2 (共 2 个帖子)
正在查看 2 个帖子:1-2 (共 2 个帖子)

上传图片

拖拽或点击选择图片(最多五张)

回复至:如何进行古籍格式转换工作流?
您的信息:



发帖/回帖前,请了解相关版规

0,邮箱地址尽量真实有效,随意填写的可能会被系统误判为垃圾内容。
1,不要开书单。单个帖子尽量发布一种书籍需求。
2,在搜索不到相关主题的情况下,尽量发新帖(发帖标题最好带上书名)。不要在他人帖子中回复某种书籍需要。
3,发帖提问标题尽量简单明了。发帖内容不要太过简略,请对书籍内容、版本或作者作简要说明。
4,出版于1976年以后的资源需求或分享将会被清理删除。