Surface mirrors ref/hare/shlex/{split,escape}.ha:
shlex.syntaxerr !void
shlex.strerror(syntaxerr) str
shlex.split(str) ([]str | syntaxerr)
shlex.quote(*io.stream, s) (i32 | io.closed)
shlex.quotestr(s) str
strings.freeall([]str) added as the natural disposer (placed next
to strings.dup, the natural creator). Skips empty {nil,0} elements
and the header free when cap==0.
POSIX rules:
- whitespace separators ' '/'\t'/'\n' (collapse runs).
- single-quote: literal until closing "'" (no escapes inside).
- double-quote: '\<c>' processed inside, any <c> (Hare-faithful;
more permissive than POSIX strict). Unterminated → syntaxerr.
- outside quotes: '\<c>' → literal <c>; '\<newline>' deleted
(line continuation); trailing bare '\' → syntaxerr.
- "" / '' preserve a literal empty-string token (dirty flag).
Divergences from Hare (all documented in shlex.ww header):
- drop nomem (os.alloc aborts on OOM, same precedent as
strings.dup, getopt.appendoption).
- byte-wise cursor instead of strings::iterator (no UTF-8 rune
iteration in the language stack yet; same precedent as fnmatch).
- *io.stream (not io::handle); (i32 | io.closed) (lib/io's
stream vtable doesn't model wider io::error yet).
- appendstr / dupstr workarounds graduate when task #17
(cgen mod-mangles fn labels) lands.
Test: 4 @test fns (test_split / test_quote / test_quotestr /
test_strerror), table-driven via check1/check2/check3/checkerr/
checkquote helpers. 12 split rows + 4 quote rows ported verbatim
from ref/hare/shlex/+test.ha; empty-input ([]) and empty-quote
('') edges added per documented behaviour. @test fns prefixed
test_* to avoid the use-shlex flat-concat namespace collision
on bare split / quote / quotestr / strerror names.
254 lines
6.9 KiB
Plaintext
254 lines
6.9 KiB
Plaintext
// strings — operations over the immutable str type ({ *u8, len }).
|
|
// Mirrors Hare's strings::; `len` and `is-empty` aren't functions
|
|
// (callers use `s.len` and `s.len == 0` directly).
|
|
|
|
use os;
|
|
|
|
// compare — bytewise three-way comparison: negative if a<b, 0 if equal,
|
|
// positive if a>b. Matches Hare's strings::compare. ASCII-order, not
|
|
// locale-aware. Callers that just need equality use `compare(a, b) == 0`.
|
|
export fn compare(a: str, b: str) i32 = {
|
|
let n: i32 = a.len;
|
|
if (b.len < n) { n = b.len; };
|
|
let i: i32 = 0;
|
|
for (i < n) {
|
|
if (a[i] != b[i]) { return (a[i]: i32) - (b[i]: i32); };
|
|
i += 1;
|
|
};
|
|
return a.len - b.len;
|
|
};
|
|
|
|
export fn hasprefix(s: str, p: str) bool = {
|
|
if (p.len > s.len) { return false; };
|
|
let i: i32 = 0;
|
|
for (i < p.len) {
|
|
if (s[i] != p[i]) { return false; };
|
|
i += 1;
|
|
};
|
|
return true;
|
|
};
|
|
|
|
export fn hassuffix(s: str, suf: str) bool = {
|
|
if (suf.len > s.len) { return false; };
|
|
let off: i32 = s.len - suf.len;
|
|
let i: i32 = 0;
|
|
for (i < suf.len) {
|
|
if (s[off + i] != suf[i]) { return false; };
|
|
i += 1;
|
|
};
|
|
return true;
|
|
};
|
|
|
|
// byteindex — first byte position of `needle` in `s`. Mirrors Hare's
|
|
// strings::byteindex: a single-codepoint rune scans for the byte that
|
|
// encodes it (ASCII only here — multi-byte UTF-8 awaits utf8 encode),
|
|
// a str needle scans for the substring. Returns void if absent.
|
|
export fn byteindex(s: str, needle: (str | rune)) (i32 | void) = {
|
|
match (needle) {
|
|
case let r: rune => {
|
|
let c: u8 = r: u8;
|
|
let i: i32 = 0;
|
|
for (i < s.len) {
|
|
if (s[i] == c) { return i; };
|
|
i += 1;
|
|
};
|
|
return;
|
|
};
|
|
case let sub: str => {
|
|
if (sub.len == 0) { return 0; };
|
|
if (sub.len > s.len) { return; };
|
|
let last: i32 = s.len - sub.len;
|
|
let i: i32 = 0;
|
|
for (i <= last) {
|
|
let j: i32 = 0;
|
|
let ok: bool = true;
|
|
for (j < sub.len) {
|
|
if (s[i + j] != sub[j]) { ok = false; j = sub.len; }
|
|
else { j += 1; };
|
|
};
|
|
if (ok) { return i; };
|
|
i += 1;
|
|
};
|
|
return;
|
|
};
|
|
};
|
|
return;
|
|
};
|
|
|
|
// contains — true iff `sub` appears in `s`. Mirrors Hare's
|
|
// strings::contains shape (byte-wise on the str-needle case).
|
|
export fn contains(s: str, sub: str) bool = {
|
|
let r: (i32 | void) = byteindex(s, sub);
|
|
match (r) {
|
|
case let i: i32 => return true;
|
|
case void => return false;
|
|
};
|
|
return false;
|
|
};
|
|
|
|
// concat — joins two strings into a fresh str. Caller owns the
|
|
// returned str's storage; release via `os.free(r.ptr, r.len)`. Mirrors
|
|
// Hare's strings::concat shape.
|
|
export fn concat(a: str, b: str) str = {
|
|
let total: i32 = a.len + b.len;
|
|
let buf: *u8 = os.alloc(total: u64): *u8;
|
|
let i: i32 = 0;
|
|
for (i < a.len) { buf[i] = a[i]; i += 1; };
|
|
let j: i32 = 0;
|
|
for (j < b.len) { buf[a.len + j] = b[j]; j += 1; };
|
|
let r: str;
|
|
r.ptr = buf;
|
|
r.len = total;
|
|
return r;
|
|
};
|
|
|
|
// dup — duplicate a string into a fresh allocation. Caller owns the
|
|
// returned str's storage; release via `os.free(r.ptr, r.len)`. Mirrors
|
|
// Hare's strings::dup shape — Hare returns `(str | nomem)`, ww doesn't
|
|
// have nomem (os.alloc aborts on OOM), so we return plain `str`.
|
|
//
|
|
// Empty input yields a `{nil, 0}` str — Hare returns the static empty
|
|
// string; same observable result.
|
|
export fn dup(s: str) str = {
|
|
let r: str;
|
|
r.ptr = nil;
|
|
r.len = 0;
|
|
if (s.len == 0) { return r; };
|
|
let buf: *u8 = os.alloc(s.len: u64): *u8;
|
|
let i: i32 = 0;
|
|
for (i < s.len) { buf[i] = s[i]; i += 1; };
|
|
r.ptr = buf;
|
|
r.len = s.len;
|
|
return r;
|
|
};
|
|
|
|
// freeall — release every str element in `s` (those that were
|
|
// individually allocated) plus the slice's backing storage. Mirrors
|
|
// Hare's strings::freeall — the natural disposer for any function
|
|
// returning a fresh `[]str` of dup'd elements (e.g. shlex.split).
|
|
//
|
|
// Each element is freed via os.free at its own length; the slice
|
|
// header storage is freed at `cap * 16` bytes (one str = 16B). Empty
|
|
// elements (`{nil, 0}` from a zero-length dup) are skipped — calling
|
|
// os.free on a nil pointer at len 0 would tickle the rt_free guard
|
|
// that the runtime treats as a logic bug.
|
|
//
|
|
// `cap == 0` means the slice was never grown (empty `[]str` with no
|
|
// backing allocation); skip the header free in that case too.
|
|
export fn freeall(s: []str) void = {
|
|
let i: i32 = 0;
|
|
for (i < s.len) {
|
|
if (s[i].len > 0) {
|
|
os.free(s[i].ptr: *void, s[i].len: u64);
|
|
};
|
|
i += 1;
|
|
};
|
|
if (s.cap > 0) {
|
|
os.free(s.ptr: *void, (s.cap: u64) * 16u64);
|
|
};
|
|
};
|
|
|
|
// rbyteindex — last byte position of `needle` in `s`. Mirrors Hare's
|
|
// strings::rbyteindex. Rune needle scans for the byte that encodes it
|
|
// (ASCII only); str needle scans for the substring. Empty str needle
|
|
// matches at s.len.
|
|
export fn rbyteindex(s: str, needle: (str | rune)) (i32 | void) = {
|
|
match (needle) {
|
|
case let r: rune => {
|
|
let c: u8 = r: u8;
|
|
let i: i32 = s.len - 1;
|
|
for (i >= 0) {
|
|
if (s[i] == c) { return i; };
|
|
i -= 1;
|
|
};
|
|
return;
|
|
};
|
|
case let sub: str => {
|
|
if (sub.len == 0) { return s.len; };
|
|
if (sub.len > s.len) { return; };
|
|
let i: i32 = s.len - sub.len;
|
|
for (i >= 0) {
|
|
let j: i32 = 0;
|
|
let ok: bool = true;
|
|
for (j < sub.len) {
|
|
if (s[i + j] != sub[j]) { ok = false; j = sub.len; }
|
|
else { j += 1; };
|
|
};
|
|
if (ok) { return i; };
|
|
i -= 1;
|
|
};
|
|
return;
|
|
};
|
|
};
|
|
return;
|
|
};
|
|
|
|
// sub — borrowed substring `s[start..end]`. Mirrors Hare's
|
|
// strings::sub. Caller must ensure 0 <= start <= end <= s.len; out-of-
|
|
// range indices are clamped silently here, where Hare aborts.
|
|
export fn sub(s: str, start: i32, end: i32) str = {
|
|
let lo: i32 = start;
|
|
let hi: i32 = end;
|
|
if (lo < 0) { lo = 0; };
|
|
if (hi > s.len) { hi = s.len; };
|
|
if (hi < lo) { hi = lo; };
|
|
let r: str;
|
|
r.ptr = s.ptr + (lo: u64);
|
|
r.len = hi - lo;
|
|
return r;
|
|
};
|
|
|
|
// trimprefix — `s` with `pre` stripped from the front, or `s`
|
|
// unchanged if it doesn't start with `pre`. Returns a borrowed view.
|
|
// Mirrors Hare's strings::trimprefix.
|
|
export fn trimprefix(s: str, pre: str) str = {
|
|
if (!hasprefix(s, pre)) { return s; };
|
|
let r: str;
|
|
r.ptr = s.ptr + (pre.len: u64);
|
|
r.len = s.len - pre.len;
|
|
return r;
|
|
};
|
|
|
|
// trimsuffix — `s` with `suf` stripped from the end, or `s` unchanged
|
|
// if it doesn't end with `suf`. Returns a borrowed view. Mirrors
|
|
// Hare's strings::trimsuffix.
|
|
export fn trimsuffix(s: str, suf: str) str = {
|
|
if (!hassuffix(s, suf)) { return s; };
|
|
let r: str;
|
|
r.ptr = s.ptr;
|
|
r.len = s.len - suf.len;
|
|
return r;
|
|
};
|
|
|
|
// ltrimbyte / rtrimbyte / trimbyte — strip occurrences of a single
|
|
// byte from the left, right, or both ends. Returns a borrowed view.
|
|
// Hare's strings::ltrim / rtrim / trim take a rune varargs set; ww's
|
|
// subset takes a single byte (the common ASCII case).
|
|
export fn ltrimbyte(s: str, c: u8) str = {
|
|
let i: i32 = 0;
|
|
for (i < s.len) {
|
|
if (s[i] != c) { break; };
|
|
i += 1;
|
|
};
|
|
let r: str;
|
|
r.ptr = s.ptr + (i: u64);
|
|
r.len = s.len - i;
|
|
return r;
|
|
};
|
|
|
|
export fn rtrimbyte(s: str, c: u8) str = {
|
|
let n: i32 = s.len;
|
|
for (n > 0) {
|
|
if (s[n - 1] != c) { break; };
|
|
n -= 1;
|
|
};
|
|
let r: str;
|
|
r.ptr = s.ptr;
|
|
r.len = n;
|
|
return r;
|
|
};
|
|
|
|
export fn trimbyte(s: str, c: u8) str = {
|
|
return rtrimbyte(ltrimbyte(s, c), c);
|
|
};
|