如何读取大型平面文件
How do I read in a large flat file
我有一个平面文件,其中包含 339276 行文本,大小为 62.1 MB。我试图读入所有行,根据我拥有的某些条件解析它们,然后将它们插入数据库。
我最初尝试使用 bufio.Scan() 循环和 bufio.Text() 来获取该行,但我 运行 超出了缓冲区 space。我切换到使用 bufio.ReadLine/ReadString/ReadByte (我尝试了每个)并且每个都遇到了同样的问题。我没有足够的缓冲区 space。
我尝试使用读取并设置缓冲区大小,但正如文档所说,它实际上是一个常量,可以变得更小但永远不会大于 64*1024 字节。然后我尝试使用 File.ReadAt 设置起始 postilion 并在我引入每个部分时移动它但无济于事。我查看了以下示例和解释(并非详尽列表):
Read text file into string array (and write)
How to Read last lines from a big file with Go every 10 secs
reading file line by line in go
如何将整个文件(逐行或一次读取整个文件)读入一个切片,然后我可以对行进行处理?
这是我试过的一些代码:
file, err := os.Open(feedFolder + value)
handleError(err)
defer file.Close()
// fileInfo, _ := file.Stat()
var linesInFile []string
r := bufio.NewReader(file)
for {
path, err := r.ReadLine("\n") // 0x0A separator = newline
linesInFile = append(linesInFile, path)
if err == io.EOF {
fmt.Printf("End Of File: %s", err)
break
} else if err != nil {
handleError(err) // if you return error
}
}
fmt.Println("Last Line: ", linesInFile[len(linesInFile)-1])
这是我尝试过的其他方法:
var fileSize int64 = fileInfo.Size()
fmt.Printf("File Size: %d\t", fileSize)
var bufferSize int64 = 1024 * 60
bytes := make([]byte, bufferSize)
var fullFile []byte
var start int64 = 0
var interationCounter int64 = 1
var currentErr error = nil
for currentErr != io.EOF {
_, currentErr = file.ReadAt(bytes, st)
fullFile = append(fullFile, bytes...)
start = (bufferSize * interationCounter) + 1
interationCounter++
}
fmt.Printf("Err: %s\n", currentErr)
fmt.Printf("fullFile Size: %s\n", len(fullFile))
fmt.Printf("Start: %d", start)
var currentLine []string
for _, value := range fullFile {
if string(value) != "\n" {
currentLine = append(currentLine, string(value))
} else {
singleLine := strings.Join(currentLine, "")
linesInFile = append(linesInFile, singleLine)
currentLine = nil
}
}
我很茫然。要么我不完全了解缓冲区的工作原理,要么我不了解其他内容。谢谢阅读。
不清楚是否有必要在解析所有行并将它们插入数据库之前读入它们。尽量避免这种情况。
您有一个小文件:"a flat file that has 339276 line of text in it for a size of 62.1 MB." 例如,
package main
import (
"bytes"
"fmt"
"io"
"io/ioutil"
)
func readLines(filename string) ([]string, error) {
var lines []string
file, err := ioutil.ReadFile(filename)
if err != nil {
return lines, err
}
buf := bytes.NewBuffer(file)
for {
line, err := buf.ReadString('\n')
if len(line) == 0 {
if err != nil {
if err == io.EOF {
break
}
return lines, err
}
}
lines = append(lines, line)
if err != nil && err != io.EOF {
return lines, err
}
}
return lines, nil
}
func main() {
// a flat file that has 339276 lines of text in it for a size of 62.1 MB
filename := "flat.file"
lines, err := readLines(filename)
fmt.Println(len(lines))
if err != nil {
fmt.Println(err)
return
}
}
bufio.Scan()
和 bufio.Text()
在一个循环中对我来说非常适用于尺寸大得多的文件,所以我想你的行数超过了缓冲区容量。那么
- 检查你的行结尾
- 你使用哪个 Go 版本
path, err :=r.ReadLine("\n") // 0x0A separator = newline
?看起来 func (b *bufio.Reader) ReadLine() (line []byte, isPrefix bool, err error)
具有 return 值 isPrefix
专门针对您的用例
http://golang.org/pkg/bufio/#Reader.ReadLine
在我看来 readLines
的这种变体比建议的 peterSO
更短更快
func readLines(filename string) (map[int]string, error) {
lines := make(map[int]string)
data, err := ioutil.ReadFile(filename)
if err != nil {
return nil, err
}
for n, line := range strings.Split(string(data), "\n") {
lines[n] = line
}
return lines, nil
}
package main
import (
"fmt"
"os"
"log"
"bufio"
)
func main() {
FileName := "assets/file.txt"
file, err := os.Open(FileName)
if err != nil {
log.Fatal(err)
}
defer file.Close()
scanner := bufio.NewScanner(file)
for scanner.Scan() {
fmt.Println(scanner.Text())
}
}
我有一个平面文件,其中包含 339276 行文本,大小为 62.1 MB。我试图读入所有行,根据我拥有的某些条件解析它们,然后将它们插入数据库。
我最初尝试使用 bufio.Scan() 循环和 bufio.Text() 来获取该行,但我 运行 超出了缓冲区 space。我切换到使用 bufio.ReadLine/ReadString/ReadByte (我尝试了每个)并且每个都遇到了同样的问题。我没有足够的缓冲区 space。
我尝试使用读取并设置缓冲区大小,但正如文档所说,它实际上是一个常量,可以变得更小但永远不会大于 64*1024 字节。然后我尝试使用 File.ReadAt 设置起始 postilion 并在我引入每个部分时移动它但无济于事。我查看了以下示例和解释(并非详尽列表):
Read text file into string array (and write) How to Read last lines from a big file with Go every 10 secs reading file line by line in go
如何将整个文件(逐行或一次读取整个文件)读入一个切片,然后我可以对行进行处理?
这是我试过的一些代码:
file, err := os.Open(feedFolder + value)
handleError(err)
defer file.Close()
// fileInfo, _ := file.Stat()
var linesInFile []string
r := bufio.NewReader(file)
for {
path, err := r.ReadLine("\n") // 0x0A separator = newline
linesInFile = append(linesInFile, path)
if err == io.EOF {
fmt.Printf("End Of File: %s", err)
break
} else if err != nil {
handleError(err) // if you return error
}
}
fmt.Println("Last Line: ", linesInFile[len(linesInFile)-1])
这是我尝试过的其他方法:
var fileSize int64 = fileInfo.Size()
fmt.Printf("File Size: %d\t", fileSize)
var bufferSize int64 = 1024 * 60
bytes := make([]byte, bufferSize)
var fullFile []byte
var start int64 = 0
var interationCounter int64 = 1
var currentErr error = nil
for currentErr != io.EOF {
_, currentErr = file.ReadAt(bytes, st)
fullFile = append(fullFile, bytes...)
start = (bufferSize * interationCounter) + 1
interationCounter++
}
fmt.Printf("Err: %s\n", currentErr)
fmt.Printf("fullFile Size: %s\n", len(fullFile))
fmt.Printf("Start: %d", start)
var currentLine []string
for _, value := range fullFile {
if string(value) != "\n" {
currentLine = append(currentLine, string(value))
} else {
singleLine := strings.Join(currentLine, "")
linesInFile = append(linesInFile, singleLine)
currentLine = nil
}
}
我很茫然。要么我不完全了解缓冲区的工作原理,要么我不了解其他内容。谢谢阅读。
不清楚是否有必要在解析所有行并将它们插入数据库之前读入它们。尽量避免这种情况。
您有一个小文件:"a flat file that has 339276 line of text in it for a size of 62.1 MB." 例如,
package main
import (
"bytes"
"fmt"
"io"
"io/ioutil"
)
func readLines(filename string) ([]string, error) {
var lines []string
file, err := ioutil.ReadFile(filename)
if err != nil {
return lines, err
}
buf := bytes.NewBuffer(file)
for {
line, err := buf.ReadString('\n')
if len(line) == 0 {
if err != nil {
if err == io.EOF {
break
}
return lines, err
}
}
lines = append(lines, line)
if err != nil && err != io.EOF {
return lines, err
}
}
return lines, nil
}
func main() {
// a flat file that has 339276 lines of text in it for a size of 62.1 MB
filename := "flat.file"
lines, err := readLines(filename)
fmt.Println(len(lines))
if err != nil {
fmt.Println(err)
return
}
}
bufio.Scan()
和 bufio.Text()
在一个循环中对我来说非常适用于尺寸大得多的文件,所以我想你的行数超过了缓冲区容量。那么
- 检查你的行结尾
- 你使用哪个 Go 版本
path, err :=r.ReadLine("\n") // 0x0A separator = newline
?看起来func (b *bufio.Reader) ReadLine() (line []byte, isPrefix bool, err error)
具有 return 值isPrefix
专门针对您的用例 http://golang.org/pkg/bufio/#Reader.ReadLine
在我看来 readLines
的这种变体比建议的 peterSO
func readLines(filename string) (map[int]string, error) {
lines := make(map[int]string)
data, err := ioutil.ReadFile(filename)
if err != nil {
return nil, err
}
for n, line := range strings.Split(string(data), "\n") {
lines[n] = line
}
return lines, nil
}
package main
import (
"fmt"
"os"
"log"
"bufio"
)
func main() {
FileName := "assets/file.txt"
file, err := os.Open(FileName)
if err != nil {
log.Fatal(err)
}
defer file.Close()
scanner := bufio.NewScanner(file)
for scanner.Scan() {
fmt.Println(scanner.Text())
}
}