]> git.saurik.com Git - bison.git/blobdiff - src/scan-code.l
Do not allow identifiers that start with a negative number.
[bison.git] / src / scan-code.l
index 572f806f291b8f995883a65da893053ee813abfc..e3e6b6536e93417ce043d1a36537ed06070e57c4 100644 (file)
@@ -1,6 +1,6 @@
 /* Bison Action Scanner                             -*- C -*-
 
-   Copyright (C) 2006, 2007, 2008 Free Software Foundation, Inc.
+   Copyright (C) 2006-2011 Free Software Foundation, Inc.
 
    This file is part of Bison, the GNU Compiler Compiler.
 
@@ -17,7 +17,7 @@
    You should have received a copy of the GNU General Public License
    along with this program.  If not, see <http://www.gnu.org/licenses/>.  */
 
-%option debug nodefault nounput noyywrap never-interactive
+%option debug nodefault noinput nounput noyywrap never-interactive
 %option prefix="code_" outfile="lex.yy.c"
 
 %{
 #include "complain.h"
 #include "reader.h"
 #include "getargs.h"
-#include <get-errno.h>
-#include <quote.h>
-
 #include "scan-code.h"
 #include "symlist.h"
 
+#include <c-ctype.h>
+#include <get-errno.h>
+#include <quote.h>
+
 /* The current calling start condition: SC_RULE_ACTION or
    SC_SYMBOL_ACTION. */
 # define YY_DECL static char *code_lex (code_props *self, int sc_context)
@@ -49,7 +50,7 @@ static void handle_action_dollar (symbol_list *rule, char *cp,
                                  location dollar_loc);
 static void handle_action_at (symbol_list *rule, char *cp, location at_loc);
 
-/* A string to be pushed to obstack after dollar/at has been handled */
+/* A string to be pushed to obstack after dollar/at has been handled. */
 static char *ref_tail_fields;
 
 static location the_location;
@@ -81,9 +82,10 @@ tag   [^\0\n>]+
 splice  (\\[ \f\t\v]*\n)*
 
 /* C style identifier. Must start with letter. Will be used for
-   named symbol references. */
-letter   [-.abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ_]
-id       {letter}({letter}|[0-9])*
+   named symbol references. Shall be kept synchronized with
+   scan-gram.l "letter" and "id". */
+letter   [.abcdefghijklmnopqrstuvwxyzABCDEFGHIJKLMNOPQRSTUVWXYZ_]
+id       -*(-|{letter}({letter}|[-0-9])*)
 ref      -?[0-9]+|{id}|"["{id}"]"|"$"
 
 %%
@@ -181,7 +183,7 @@ ref      -?[0-9]+|{id}|"["{id}"]"|"$"
   "$"("<"{tag}">")?{ref}  {
     ref_tail_fields = 0;
     handle_action_dollar (self->rule, yytext, *loc);
-    if (ref_tail_fields != NULL) {
+    if (ref_tail_fields) {
       obstack_sgrow (&obstack_for_string, ref_tail_fields);
     }
     need_semicolon = true;
@@ -189,7 +191,7 @@ ref      -?[0-9]+|{id}|"["{id}"]"|"$"
   "@"{ref} {
     ref_tail_fields = 0;
     handle_action_at (self->rule, yytext, *loc);
-    if (ref_tail_fields != NULL) {
+    if (ref_tail_fields) {
       obstack_sgrow (&obstack_for_string, ref_tail_fields);
     }
     need_semicolon = true;
@@ -243,7 +245,20 @@ ref      -?[0-9]+|{id}|"["{id}"]"|"$"
   {splice}  STRING_GROW;
   [\n\r]    STRING_GROW; if (in_cpp) in_cpp = need_semicolon = false; 
   [ \t\f]   STRING_GROW;
-  .         STRING_GROW; need_semicolon = true;
+
+  /* YYFAIL is undocumented and was formally deprecated in Bison
+     2.4.2.  */
+  YYFAIL {
+    STRING_GROW; need_semicolon = true;
+    warn_at (*loc, _("use of YYFAIL, which is deprecated and will be"
+                     " removed"));
+  }
+
+  /* The sole purpose of this is to make sure identifiers that merely
+     contain YYFAIL don't produce the above warning.  */
+  [A-Za-z_][0-9A-Za-z_]* STRING_GROW; need_semicolon = true;
+
+  . STRING_GROW; need_semicolon = true;
 }
 
 <SC_SYMBOL_ACTION>
@@ -285,60 +300,57 @@ ref      -?[0-9]+|{id}|"["{id}"]"|"$"
 
 %%
 
-
 static inline bool
-symbol_list_null(symbol_list *l)
-{
-  if (l && !(l->content_type == SYMLIST_SYMBOL && l->content.sym == NULL))
-    return false;
-  else
-    return true;
-}
-
-static inline bool
-is_dot_or_dash(char ch)
+is_dot_or_dash (char ch)
 {
   return ch == '.' || ch == '-';
 }
 
 static inline bool
-is_digit(char ch)
+contains_dot_or_dash (const char* p)
 {
-  return '0' <= ch && ch <= '9';
+  for (; *p; ++p)
+    if (is_dot_or_dash (*p))
+      return true;
+  return false;
 }
 
-static inline bool
-contains_dot_or_dash(const char* str)
-{
-  return strpbrk(str, ".-") != NULL;
-}
-
-#define VARIANT_HIDDEN (1 << 0)
-#define VARIANT_BAD_BRACKETING (1 << 1)
-#define VARIANT_NOT_VISIBLE_FROM_MIDRULE (1 << 2)
-
+/* Defines a variant of a symbolic name resolution. */
 typedef struct
 {
   /* Index in symbol list. */
-  long int ind;
+  unsigned symbol_index;
 
   /* Matched symbol id and loc. */
   uniqstr id;
   location loc;
 
-  /* Hidding named reference. */
+  /* Hiding named reference. */
   named_ref* hidden_by;
 
-  /* Error flags. */
+  /* Error flags. May contain zero (no errors) or
+     a combination of VARIANT_* values. */
   unsigned err;
 } variant;
 
+/* Set when the variant refers to a symbol hidden
+   by an explicit symbol reference. */
+#define VARIANT_HIDDEN (1 << 0)
+
+/* Set when the variant refers to a symbol containing
+   dots or dashes. Will require explicit bracketing. */
+#define VARIANT_BAD_BRACKETING (1 << 1)
+
+/* Set when the variant refers to a symbol which is
+   not visible from current midrule. */
+#define VARIANT_NOT_VISIBLE_FROM_MIDRULE (1 << 2)
+
 static variant *variant_table = 0;
 static unsigned variant_table_size = 0;
 static unsigned variant_count = 0;
 
 static variant *
-variant_table_grow()
+variant_table_grow (void)
 {
   ++variant_count;
   if (variant_count > variant_table_size)
@@ -351,17 +363,22 @@ variant_table_grow()
   return &variant_table[variant_count - 1];
 }
 
+static void
+variant_table_free (void)
+{
+  free (variant_table);
+  variant_table = 0;
+  variant_table_size = variant_count = 0;
+}
+
 static char *
-find_prefix_end(const char *prefix, char *begin, char *end)
+find_prefix_end (const char *prefix, char *begin, char *end)
 {
   char *ptr = begin;
 
-  while (*prefix && ptr != end)
-    {
-      if (*prefix != *ptr)
-       return 0;
-      ++prefix, ++ptr;
-    }
+  for (; *prefix && ptr != end; ++prefix, ++ptr)
+    if (*prefix != *ptr)
+      return 0;
 
   if (*prefix)
     return 0;
@@ -370,20 +387,20 @@ find_prefix_end(const char *prefix, char *begin, char *end)
 }
 
 static variant *
-variant_add(uniqstr id, location loc, long int ind,
-           char *cp, char *cp_end, bool exact_mode)
+variant_add (uniqstr id, location id_loc, unsigned symbol_index,
+            char *cp, char *cp_end, bool explicit_bracketing)
 {
   char *prefix_end;
 
-  prefix_end = find_prefix_end(id, cp, cp_end);
+  prefix_end = find_prefix_end (id, cp, cp_end);
   if (prefix_end &&
       (prefix_end == cp_end ||
-       (!exact_mode && is_dot_or_dash(*prefix_end))))
+       (!explicit_bracketing && is_dot_or_dash (*prefix_end))))
     {
-      variant *r = variant_table_grow();
-      r->ind = ind;
+      variant *r = variant_table_grow ();
+      r->symbol_index = symbol_index;
       r->id = id;
-      r->loc = loc;
+      r->loc = id_loc;
       r->hidden_by = NULL;
       r->err = 0;
       return r;
@@ -392,207 +409,266 @@ variant_add(uniqstr id, location loc, long int ind,
     return NULL;
 }
 
+static const char *
+get_at_spec(unsigned symbol_index)
+{
+  static char at_buf[20];
+  if (symbol_index == 0)
+    strcpy (at_buf, "$$");
+  else
+    snprintf (at_buf, sizeof at_buf, "$%u", symbol_index);
+  return at_buf;
+}
+
+static void
+show_sub_messages (const char* cp, bool explicit_bracketing,
+                   int midrule_rhs_index, char dollar_or_at,
+                   bool is_warning, unsigned indent)
+{
+  unsigned i;
+
+  for (i = 0; i < variant_count; ++i)
+    {
+      const variant *var = &variant_table[i];
+      const char *at_spec = get_at_spec (var->symbol_index);
+
+      if (var->err == 0)
+        {
+          if (is_warning)
+            warn_at_indent (var->loc, &indent, _("refers to: %c%s at %s"),
+                            dollar_or_at, var->id, at_spec);
+          else
+            complain_at_indent (var->loc, &indent, _("refers to: %c%s at %s"),
+                                dollar_or_at, var->id, at_spec);
+        }
+      else
+       {
+         static struct obstack msg_buf;
+         const char *tail = explicit_bracketing ? "" :
+           cp + strlen (var->id);
+         const char *id = var->hidden_by ? var->hidden_by->id :
+           var->id;
+         location id_loc = var->hidden_by ? var->hidden_by->loc :
+           var->loc;
+
+         /* Create the explanation message. */
+         obstack_init (&msg_buf);
+
+         obstack_fgrow1 (&msg_buf, _("possibly meant: %c"), dollar_or_at);
+         if (contains_dot_or_dash (id))
+           obstack_fgrow1 (&msg_buf, "[%s]", id);
+         else
+           obstack_sgrow (&msg_buf, id);
+         obstack_sgrow (&msg_buf, tail);
+
+         if (var->err & VARIANT_HIDDEN)
+           {
+             obstack_fgrow1 (&msg_buf, _(", hiding %c"), dollar_or_at);
+             if (contains_dot_or_dash (var->id))
+               obstack_fgrow1 (&msg_buf, "[%s]", var->id);
+             else
+               obstack_sgrow (&msg_buf, var->id);
+             obstack_sgrow (&msg_buf, tail);
+           }
+
+         obstack_fgrow1 (&msg_buf, _(" at %s"), at_spec);
+
+         if (var->err & VARIANT_NOT_VISIBLE_FROM_MIDRULE)
+            {
+              const char *format =
+                _(", cannot be accessed from mid-rule action at $%d");
+              obstack_fgrow1 (&msg_buf, format, midrule_rhs_index);
+            }
+
+         obstack_1grow (&msg_buf, '\0');
+          if (is_warning)
+            warn_at_indent (id_loc, &indent, "%s",
+                            (char *) obstack_finish (&msg_buf));
+          else
+            complain_at_indent (id_loc, &indent, "%s",
+                                (char *) obstack_finish (&msg_buf));
+         obstack_free (&msg_buf, 0);
+       }
+    }
+}
+
+/* Returned from "parse_ref" when the reference
+   is inappropriate. */
 #define INVALID_REF (INT_MIN)
+
+/* Returned from "parse_ref" when the reference
+   points to LHS ($$) of the current rule or midrule. */
 #define LHS_REF (INT_MIN + 1)
 
+/* Sub-messages indent. */
+#define SUB_INDENT (4)
+
+/* Parse named or positional reference. In case of positional
+   references, can return negative values for $-n "deep" stack
+   accesses. */
 static long int
-parse_named_ref(char *cp, symbol_list *rule, int rule_length,
-               int midrule_rhs_index, char *text, location loc,
-               char dollar_or_at)
+parse_ref (char *cp, symbol_list *rule, int rule_length,
+          int midrule_rhs_index, char *text, location text_loc,
+          char dollar_or_at)
 {
   symbol_list *l;
   char *cp_end;
-  bool exact_mode;
-  bool has_error;
-  bool has_valid;
-  long int ind, i;
-  variant* variant;
-  char* p;
+  bool explicit_bracketing;
+  unsigned i;
+  unsigned valid_variants = 0;
+  unsigned valid_variant_index = 0;
 
   if ('$' == *cp)
     return LHS_REF;
 
-  if (is_digit (*cp) || (*cp == '-' && is_digit (* (cp + 1))))
+  if (c_isdigit (*cp) || (*cp == '-' && c_isdigit (* (cp + 1))))
     {
       long int num = strtol (cp, &cp, 10);
       if (1 - INT_MAX + rule_length <= num && num <= rule_length)
        return num;
       else
        {
-         complain_at (loc, _("integer out of range: %s"), quote (text));
+         complain_at (text_loc, _("integer out of range: %s"),
+                       quote (text));
          return INVALID_REF;
        }
     }
 
   if ('[' == *cp)
     {
-      exact_mode = true;
-
       /* Ignore the brackets. */
-      ++cp;
-      for (p = cp; *p != ']'; ++p);
+      char *p;
+      for (p = ++cp; *p != ']'; ++p)
+       continue;
       cp_end = p;
+
+      explicit_bracketing = true;
     }
   else
     {
-      exact_mode = false;
-
       /* Take all characters of the name. */
+      char* p;
       for (p = cp; *p; ++p)
-       if (is_dot_or_dash(*p))
+       if (is_dot_or_dash (*p))
          {
            ref_tail_fields = p;
            break;
          }
-      for (p = cp; *p; ++p);
+      for (p = cp; *p; ++p)
+       continue;
       cp_end = p;
+
+      explicit_bracketing = false;
     }
 
   /* Add all relevant variants. */
-  variant_count = 0;
-  for (ind = 0, l = rule; !symbol_list_null(l); ++ind, l = l->next)
-    {
-      if (l->content_type != SYMLIST_SYMBOL)
-       continue;
-
-      variant = variant_add(l->content.sym->tag, l->sym_loc, ind,
-                           cp, cp_end, exact_mode);
-
-      if (variant && l->named_ref)
-       variant->hidden_by = l->named_ref;
-
-      if (l->named_ref)
-       variant_add(l->named_ref->id, l->named_ref->loc, ind,
-                   cp, cp_end, exact_mode);
-    }
+  {
+    unsigned symbol_index;
+    variant_count = 0;
+    for (symbol_index = 0, l = rule; !symbol_list_null (l);
+         ++symbol_index, l = l->next)
+      {
+       variant *var;
+       if (l->content_type != SYMLIST_SYMBOL)
+         continue;
+
+       var = variant_add (l->content.sym->tag, l->sym_loc,
+                           symbol_index, cp, cp_end, explicit_bracketing);
+       if (var && l->named_ref)
+         var->hidden_by = l->named_ref;
+
+       if (l->named_ref)
+         variant_add (l->named_ref->id, l->named_ref->loc,
+                       symbol_index, cp, cp_end, explicit_bracketing);
+      }
+  }
 
   /* Check errors. */
-  has_error = false;
-  has_valid = false;
   for (i = 0; i < variant_count; ++i)
     {
-      variant = &variant_table[i];
-      ind = variant->ind;
+      variant *var = &variant_table[i];
+      unsigned symbol_index = var->symbol_index;
 
       /* Check visibility from mid-rule actions. */
-      if (midrule_rhs_index != 0 &&
-         (ind == 0 || ind > midrule_rhs_index))
-       {
-         variant->err |= VARIANT_NOT_VISIBLE_FROM_MIDRULE;
-         has_error = true;
-       }
+      if (midrule_rhs_index != 0
+         && (symbol_index == 0 || midrule_rhs_index < symbol_index))
+        var->err |= VARIANT_NOT_VISIBLE_FROM_MIDRULE;
 
       /* Check correct bracketing. */
-      if (!exact_mode && contains_dot_or_dash(variant->id))
-       {
-         variant->err |= VARIANT_BAD_BRACKETING;
-         has_error = true;
-       }
+      if (!explicit_bracketing && contains_dot_or_dash (var->id))
+        var->err |= VARIANT_BAD_BRACKETING;
 
       /* Check using of hidden symbols. */
-      if (variant->hidden_by != NULL)
-       {
-         variant->err |= VARIANT_HIDDEN;
-         has_error = true;
-       }
-
-      if (!variant->err)
-       has_valid = true;
+      if (var->hidden_by)
+        var->err |= VARIANT_HIDDEN;
+
+      if (!var->err)
+        {
+          valid_variant_index = i;
+          ++valid_variants;
+        }
     }
 
-  if (variant_count == 1 && has_valid)
-    {
-      /* The only "good" case is here. */
-      ind = variant_table[0].ind;
-      if (ind == midrule_rhs_index)
-       return LHS_REF;
-      else
-       return ind;
-    }
-
-  /* Start complaining. */
-
-  if (variant_count == 0)
-    complain_at (loc, _("reference is invalid: %s, symbol not found"),
-                quote (text));
-  else if (variant_count > 1 && !has_error)
-    complain_at (loc, _("reference is ambiguous: %s"),
-                quote (text));
-  else if (variant_count > 1 && has_valid && has_error)
-    complain_at (loc, _("reference is misleading: %s"),
-                quote (text));
-  else
-    complain_at (loc, _("reference is invalid: %s"),
-                quote (text));
-
-  for (i = 0; i < variant_count; ++i)
+  switch (valid_variants)
     {
-      static char at_buf[20];
-
-      variant = &variant_table[i];
-
-      if (variant->ind == 0)
-       strcpy(at_buf, "$$");
-      else
-       snprintf(at_buf, sizeof(at_buf), "$%d", variant->ind);
-
-      if (variant->err == 0)
-       complain_at (variant->loc, _("  refers to: %c%s at %s"),
-                    dollar_or_at, variant->id, at_buf);
-      else
-       {
-         static struct obstack msg_buf;
-         const char *tail = "";
-         const char *id;
-         location loc;
-
-         if (!exact_mode)
-           tail = cp + strlen(variant->id);
-
-         if (variant->hidden_by)
-           {
-             id = variant->hidden_by->id;
-             loc = variant->hidden_by->loc;
-           }
-         else
-           {
-             id = variant->id;
-             loc = variant->loc;
-           }
-
-         /* Create the explanation message. */
-
-         obstack_init (&msg_buf);
-
-         obstack_fgrow1 (&msg_buf, "  possibly meant: %c", dollar_or_at);
-         if (contains_dot_or_dash (id))
-           obstack_fgrow1 (&msg_buf, "[%s]", id);
-         else
-           obstack_sgrow (&msg_buf, id);
-         obstack_sgrow (&msg_buf, tail);
-
-         if (variant->err & VARIANT_HIDDEN)
-           {
-             obstack_fgrow1 (&msg_buf, ", hiding %c", dollar_or_at);
-             if (contains_dot_or_dash (variant->id))
-               obstack_fgrow1 (&msg_buf, "[%s]", variant->id);
-             else
-               obstack_sgrow (&msg_buf, variant->id);
-             obstack_sgrow (&msg_buf, tail);
-           }
-
-         obstack_fgrow1 (&msg_buf, " at %s", at_buf);
-
-         if (variant->err & VARIANT_NOT_VISIBLE_FROM_MIDRULE)
-           obstack_fgrow1 (&msg_buf, ", cannot be accessed from "
-                           "mid-rule action at $%d", midrule_rhs_index);
-
-         obstack_1grow (&msg_buf, '\0');
-         complain_at (loc, _("%s"), obstack_finish (&msg_buf));
-         obstack_free (&msg_buf, 0);
-       }
+    case 0:
+      {
+        unsigned len = (explicit_bracketing || !ref_tail_fields) ?
+          cp_end - cp : ref_tail_fields - cp;
+        unsigned indent = 0;
+
+        complain_at_indent (text_loc, &indent, _("invalid reference: %s"),
+                            quote (text));
+        indent += SUB_INDENT;
+        if (midrule_rhs_index)
+          {
+            const char *format =
+              _("symbol not found in production before $%d: %.*s");
+            complain_at_indent (rule->location, &indent, format,
+                                midrule_rhs_index, len, cp);
+          }
+        else
+          {
+            const char *format =
+              _("symbol not found in production: %.*s");
+            complain_at_indent (rule->location, &indent, format,
+                                len, cp);
+          }
+
+        if (variant_count > 0)
+          show_sub_messages (cp, explicit_bracketing, midrule_rhs_index,
+                             dollar_or_at, false, indent);
+        return INVALID_REF;
+      }
+    case 1:
+      {
+        unsigned indent = 0;
+        if (variant_count > 1)
+          {
+            warn_at_indent (text_loc, &indent, _("misleading reference: %s"),
+                            quote (text));
+            show_sub_messages (cp, explicit_bracketing, midrule_rhs_index,
+                               dollar_or_at, true, indent + SUB_INDENT);
+          }
+        {
+          unsigned symbol_index =
+            variant_table[valid_variant_index].symbol_index;
+          return (symbol_index == midrule_rhs_index) ? LHS_REF : symbol_index;
+        }
+      }
+    case 2:
+    default:
+      {
+        unsigned indent = 0;
+        complain_at_indent (text_loc, &indent, _("ambiguous reference: %s"),
+                            quote (text));
+        show_sub_messages (cp, explicit_bracketing, midrule_rhs_index,
+                           dollar_or_at, false, indent + SUB_INDENT);
+        return INVALID_REF;
+      }
     }
 
+  /* Not reachable. */
   return INVALID_REF;
 }
 
@@ -617,7 +693,8 @@ handle_action_dollar (symbol_list *rule, char *text, location dollar_loc)
   char *cp = text + 1;
   char *gt_ptr = 0;
   symbol_list *effective_rule;
-  int effective_rule_length, n;
+  int effective_rule_length;
+  int n;
 
   if (rule->midrule_parent_rule)
     {
@@ -646,8 +723,8 @@ handle_action_dollar (symbol_list *rule, char *text, location dollar_loc)
       tag_seen = true;
     }
 
-  n = parse_named_ref (cp, effective_rule, effective_rule_length,
-                      rule->midrule_parent_rhs_index, text, dollar_loc, '$');
+  n = parse_ref (cp, effective_rule, effective_rule_length,
+                rule->midrule_parent_rhs_index, text, dollar_loc, '$');
 
   if (gt_ptr)
     *gt_ptr = '\0';
@@ -722,7 +799,8 @@ handle_action_at (symbol_list *rule, char *text, location at_loc)
 {
   char *cp = text + 1;
   symbol_list *effective_rule;
-  int effective_rule_length, n;
+  int effective_rule_length;
+  int n;
 
   if (rule->midrule_parent_rule)
     {
@@ -737,7 +815,7 @@ handle_action_at (symbol_list *rule, char *text, location at_loc)
 
   locations_flag = true;
 
-  n = parse_named_ref (cp, effective_rule, effective_rule_length,
+  n = parse_ref (cp, effective_rule, effective_rule_length,
                       rule->midrule_parent_rhs_index, text, at_loc, '@');
   switch (n)
     {
@@ -796,7 +874,8 @@ code_props_none_init (code_props *self)
 code_props const code_props_none = CODE_PROPS_NONE_INIT;
 
 void
-code_props_plain_init (code_props *self, char const *code, location code_loc)
+code_props_plain_init (code_props *self, char const *code,
+                      location code_loc)
 {
   self->kind = CODE_PROPS_PLAIN;
   self->code = code;
@@ -821,14 +900,14 @@ code_props_symbol_action_init (code_props *self, char const *code,
 void
 code_props_rule_action_init (code_props *self, char const *code,
                              location code_loc, symbol_list *rule,
-                            named_ref *named_ref)
+                            named_ref *name)
 {
   self->kind = CODE_PROPS_RULE_ACTION;
   self->code = code;
   self->location = code_loc;
   self->is_value_used = false;
   self->rule = rule;
-  self->named_ref = named_ref;
+  self->named_ref = name;
 }
 
 void
@@ -860,6 +939,8 @@ void
 code_scanner_free (void)
 {
   obstack_free (&obstack_for_string, 0);
+  variant_table_free ();
+
   /* Reclaim Flex's buffers.  */
   yylex_destroy ();
 }