- 作者帖子
赤霄游客庆应义塾大学古籍扫描质量较为一般,从获取的图像看,单张图像最大1M左右,pdf文档压缩后的图像一张大约100Kb,由于原始图像较为一般,pdf格式和图片格式的清晰度差别并不是太大,为了节约下载和整理时间,本次抓取了pdf格式文档。
整体有33.8G,1961册,重命名时没注意有几套书混在一起了,比如史记有三本相同名字的,重命名时后面的自动添加了(1)(2)这样的后缀名,另外实际下载的文件数是1961个,上传时重复了几个。
链接:
目录:
整个古籍库https://dcollections.lib.keio.ac.jp/ja
有富士川文庫(古医書)、汉籍等几个版块,本次下载的内容为汉籍版块的书籍,数量大致如下(手动数的):经部84种、史部32种、子部211种、集部84种、丛部2种。
抓取文档结构较为简单,重点在于获取书籍编号。
第一步,进入列表页,如https://dcollections.lib.keio.ac.jp/ja/kanseki/2
第二步,进入详情页,如https://dcollections.lib.keio.ac.jp/ja/kanseki/2/1,即可得到132X@32/1@2@1编号,稍加调整即为书籍正式编号132X-32_1-2-1。
第三步,根据编号可构造文档链接。有了链接,可以通过以下几种途径获取文档。
1、直接访问书籍分册页面获取,https://dcollections.lib.keio.ac.jp/sites/all/libraries/uv/uv.php?archive=KAN&id=132X-32_1-2-1&page=
2、访问iiif manifest可以下载iiif图像
dcollections.lib.keio.ac.jp/sites...ifest.json
3、构造pdf文档链接获取pdf
iiif.lib.keio.ac.jp/KAN/1..._1-2-1.pdf
通过以上方式都可下载所需文档。
- 作者帖子
正在查看 1 个帖子:1-1 (共 1 个帖子)
正在查看 1 个帖子:1-1 (共 1 个帖子)
正在查看 1 个帖子:1-1 (共 1 个帖子)


