Expressões regulares (regexes) são sequências de caracteres que especificam um padrão de busca em um texto.
Aprender a sintaxe de expressões regulares está além do escopo deste tópico.
Vamos nos concentrar nas expressões que o jq oferece para usar regexes.
Ferramentas diferentes implementam versões diferentes de expressões regulares.
O jq incorpora a biblioteca de regex Oniguruma, que é em grande parte compatível com as regexes do Perl v5.8.
A sintaxe específica usada pelo jq pode ser encontrada no repositório do Oniguruma no GitHub.
O jq não tem nenhuma sintaxe especial para expressões regulares.
Elas são simplesmente expressas como strings.
Isso significa que qualquer barra invertida na expressão regular precisa ser escapada na string.
Por exemplo, a classe de caractere de dígito (\d) precisa ser escrita como "\\d".
As expressões regulares no jq se limitam a um conjunto de filtros.
Quando você precisa saber se uma string corresponde a um padrão, use o filtro test.
STRING | test(REGEX)
STRING | test(REGEX; FLAGS)
STRING | test([REGEX, FLAGS])
Esse filtro retorna um resultado boolean.
"Hello World!" | test("W") # => true
"Goodbye Mars" | test("W") # => false
Quando você precisa extrair a substring que de fato correspondeu ao padrão, use o filtro match.
STRING | match(REGEX)
STRING | match(REGEX; FLAGS)
STRING | match([REGEX, FLAGS])
Esse filtro produz:
Este exemplo procura duas vogais idênticas consecutivas usando a sintaxe de referência inversa, \1.
"Hello World!" | match("([aeiou])\\1")
# => empty
"Goodbye Mars" | match("([aeiou])\\1")
# => {
# "offset": 1,
# "length": 2,
# "string": "oo",
# "captures": [
# {
# "offset": 1,
# "length": 1,
# "string": "o",
# "name": null
# }
# ]
# }
O filtro match retorna um objeto para cada correspondência.
Este exemplo mostra a flag "g" em ação para encontrar todas as vogais.
"Goodbye Mars" | match("[aeiou]"; "g")
# => { "offset": 1, "length": 1, "string": "o", "captures": [] }
# { "offset": 2, "length": 1, "string": "o", "captures": [] }
# { "offset": 6, "length": 1, "string": "e", "captures": [] }
# { "offset": 9, "length": 1, "string": "a", "captures": [] }
Assim como o filtro match, o filtro capture retorna um objeto se houver correspondência.
STRING | capture(REGEX)
STRING | capture(REGEX; FLAGS)
STRING | capture([REGEX, FLAGS])
O objeto retornado é um mapeamento das capturas nomeadas.
"JIRAISSUE-1234" | capture("(?<project>\\w+)-(?<issue_num>\\d+)")
# => {
# "project": "JIRAISSUE",
# "issue_num": "1234"
# }
O filtro scan é parecido com match com a flag "g".
STRING | scan(REGEX)
STRING | scan(REGEX; FLAGS)
# note, there is no scan([REGEX, FLAGS]) version, unlike other filters
scan produz um fluxo de substrings.
"Goodbye Mars" | scan("[aeiou]")
# => "o"
# "o"
# "e"
# "a"
Use o construtor de array [...] para capturar as substrings.
"Goodbye Mars" | [ scan("[aeiou]") ]
# => ["o", "o", "e", "a"]
Se você sabe quais partes da string quer manter, use match ou scan.
Se você sabe quais partes quer descartar, use split.
STRING | split(REGEX; FLAGS)
O filtro split de aridade 1 trata seu argumento como uma string fixa.
Para usar uma regex com split, você precisa fornecer o segundo argumento; não tem problema usar uma string vazia.
Um exemplo que divide uma string em espaços em branco arbitrários.
"first second third fourth" | split("\\s+"; "")
# => ["first", "second", "third", "fourth"]
Isto é o que acontece se esquecermos o argumento de flags.
"first second third fourth" | split("\\s+")
# => ["first second third fourth"]
Só um resultado: a string fixa \s+ não foi encontrada na entrada.
O split de aridade 1 não consegue lidar com espaços em branco arbitrários.
Dividir por um espaço dá este resultado.
"first second third fourth" | split(" ")
# => ["first", "", "", "second", "", "", "", "",
# "", "", "", "", "", "", "third", "fourth" ]
Os filtros sub e gsub podem transformar a string de entrada, substituindo as partes correspondentes da entrada por uma string de substituição.
Para substituir apenas a primeira correspondência, use sub.
Para substituir todas as correspondências, use gsub.
STRING | sub(REGEX; REPLACEMENT)
STRING | sub(REGEX; REPLACEMENT; FLAGS)
STRING | gsub(REGEX; REPLACEMENT)
STRING | gsub(REGEX; REPLACEMENT; FLAGS)
"Goodnight kittens. Goodnight mittens." | sub("night"; " morning")
# => "Good morning kittens. Goodnight mittens."
"Goodnight kittens. Goodnight mittens." | gsub("night"; " morning")
# => "Good morning kittens. Good morning mittens."
O texto de substituição pode se referir às substrings correspondentes; use capturas nomeadas e interpolação de strings.
"Some 3-letter acronyms: gnu, csv, png"
| gsub( "\\b(?<tla>[[:alpha:]]{3})\\b"; # find words 3 letters long
"\(.tla | ascii_upcase)" ) # upper-case the match
# => "Some 3-letter acronyms: GNU, CSV, PNG"
Em todos os filtros acima, FLAGS é uma string formada por zero ou mais das flags suportadas.
g - Busca global (encontra todas as correspondências, não só a primeira)i - Busca sem diferenciar maiúsculas de minúsculasm - Modo multilinha ('.' corresponde a quebras de linha)n - Ignora correspondências vaziasp - Habilita os modos s e m ao mesmo tempos - Modo de linha única ('^' -> '\A', '$' -> '\Z')l - Encontra as correspondências mais longas possíveisx - Formato estendido de regex (ignora espaços em branco e comentários)Por exemplo
"JIRAISSUE-1234" | capture("(?<project>\\w+)-(?<issue_num>\\d+)")
# or with Extended formatting
"JIRAISSUE-1234" | capture("
(?<project> \\w+ ) # the Jira project
- # followed by a hyphen
(?<issue_num> \\d+ ) # followed by digits
"; "x")