组件分享之后端组件——docconv组件将文档转换为纯文本

背景

近期正在探索前端、后端、系统端各类常用组件与工具,对其一些常见的组件进行再次整理一下,形成标准化组件专题,后续该专题将包含各类语言中的一些常用组件。欢迎大家进行持续关注。

组件基本信息

内容

本次分享的组件是用于将PDF, DOC, DOCX, XML, HTML, RTF, ODT,页面文档和图像换为纯文本使用的,该组件是基于Golang语言开发的,具体使用如下:

package main

import (
"fmt"
"log"

"code.sajari.com/docconv"
)

func main() {
res, err := docconv.ConvertPath("需要转换的文件.pdf")
if err != nil {
log.Fatal(err)
}
fmt.Println(res)
}

读取远程文件使用如下:

package main

import (
"fmt"
"log"

"code.sajari.com/docconv/client"
)

func main() {
// 使用默认端点创建一个新客户端 (localhost:8888)
c := client.New()

res, err := client.ConvertPath(c, "your-file.pdf")
if err != nil {
log.Fatal(err)
}
fmt.Println(res)
}
本文声明:

组件分享之后端组件——docconv组件将文档转换为纯文本_html

88x31.png


​知识共享许可协议​

本作品由 ​​cn華少​​ 采用 ​​知识共享署名-非商业性使用 4.0 国际许可协议​​ 进行许可。