最近小弟开发了第二个小工具(2/100),排版不好看,有错别字,再发[敲打]
界面:
一如既往的友好(难看)
第一次采用国际化开发,小弟不才,用了三种语言。
功能:
1,图像转文本。可以选择多种语言,比如中文志文,英文识别率还不错。不过公式就算了,太菜了。公式的话建议**使用其他软件**,记得有一个软件可以直接弄成latex的,非常有用,而且是免费的。(效果图:2,3,4)
2,PDF转文本。主要是面向搞自然语言处理的开发的。可以弄成txt,html,xml。特别是xml,各位大佬可以看看源代码。(效果图:6,7,转为了html,用浏览器打开)
3,将文本从横向排列转为右边开始纵向排列。也就是古文那种排版。一些奇葩癖好,可以忽略该功能(效果图 8)
4,关键句提取。阅读论文的神器。关键句提取施法了谷歌的网页排行算法。调用了 h'anlp 的api(效果图:9)
缺点:
图像识别这一块,调用了 tesseract的api,需要下载tesseract 才能使用,而且要安装相应的语言包。不过这个是开源免费的。有试过用百度识图,不过要账号。
大佬们可以把 tesseract 的源码弄成 dll,然后修改一下小弟的代码。这样就不用下载 tesseract 再使用了。(不过务必要弄下64位,否则就 GG了。小弟就用VS编义过32位的,但没用,气死。于是直接调api)
然后PDF转文本这个功能有点鸡肋。对一般人好像没啥用额
。希望大佬可以内置一个转成wold的功能,小弟在此作揖了。(既然是百变小T,那当然不用 word 啦
)
关键句提取算法,效果一般。我是用古文做测试,所以不怎么样。可能是古文很少有重复句吧。
最后,依旧是附上我的博客文章,[抱拳]
https://blog.csdn.net/weixin_42141390/article/details/107147254
欢迎关注,持续更新
- 复制链接
- 举报